地址: 泉州市刊舌入口209号 邮箱: deposed@gmail.com 工作时间:上午9点-下午8点

新闻动态

  • 首页
  • Our Portfolio
  • 豆包大模型再更新,发力多模态编程,一手实测来了

豆包大模型再更新,发力多模态编程,一手实测来了

2026-09-20

编辑|冷猫、Panda 国庆、中秋双节快到了,出游的地方想好了吗? 这件事,AI 已经能帮上忙。我们只给了模型一段话,它依靠出色的多模态编程能力,交出了一份可交互的 3D 山西旅行导览。 视频链接:https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg 提示词:收集整理山西旅游相关知识和信息,绘制一份 3D 山西旅行景点地图/导览,可移动并可交互点击,了解各个景点在哪,主要看点是什么,有什么游玩 tips。画面清晰、好看、有趣。 结果相当惊艳!打开页面,首先是一张汇集山西代表性景点的山水风格首页。进入地图后,模型按照山西的海拔起伏搭出了 3D 地形,配色清爽耐看,整体信息也大致准确,还推荐了 4 条主题旅游路线。 这是字节前两天上线的 新版豆包 2.1 Pro(版本号:0915) ,API 已在火山方舟全量上线,豆包工作同步接入。 官方公布的更新方向有四个: 多模态 Coding 、 Agent 专业任务交付 、 面向 3D 与专业图文的多模态理解 ,以及 Token 效率 。其中最受关注的是 多模态编程 ,也就是让模型看着设计稿、图纸、录屏写代码,再根据运行画面继续修改。 过去几天,我们围绕该模型做了一轮集中实测。 跟着小王子从一幅画开始 正巧,最近有位同事带了本《小王子》来编辑部,所以在这一轮实测中, 我们决定跟着小王子走一趟 :给他建星球、盖房子,再帮他和地球保持联系。 第一站,是小王子的 B612 星球。 这是一颗很小的星球,上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是:在这颗星球上设计一栋房子,整体做成一个可以摆在桌上的微缩星球摆件,并且能旋转、能看到昼夜变化。输入相关提示词,结果如下: 从模型生成效果看,成品的摆件感很足,玫瑰开放、昼夜交替,光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落,模型把昼夜循环的最高速度也设成了一天 44 次。 搭建过程中,模型会自己截图、上手操作场景,发现问题后再回头改代码。 模型自主截图操作示意,5 倍速。 星球有了,房子也得讲究一些。 我们找来一张小王子城堡的外观五视图,让模型据此重建 3D 模型。 视频链接:https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg 提示词:基于这张城堡的外观五视图,构建一个 3D 模型,要求同步生成室内布局,并且可以打开屋顶查看。 结果并非 100% 完美复刻,但整体过关,城堡各部分的空间关系还原得相当准确。提示词之外,模型还主动加上了自动旋转和墙体透视。 现在,小王子已经安好了家,我们该怎么联系他呢? 不如送他一台苹果刚发布的 iPhone Duo,当然,是数字版的。 我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示,并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。 这个任务的难点在于,折叠方式和游戏玩法都只存在于视频里,模型要先看懂画面中的开合动作和游戏规则,再把它们写成代码。 视频链接:https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg 读取并理解文件夹中的两个折叠屏视频展示和相应图片,然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的,用户可以点击侧边位置打开,然后界面上有一些图标,其中有一个 Flappy Bird 图标,点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠,并玩这个游戏。 交互的完成度不错:数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频,扇动起来穿过一个又一个的关口。有趣的是,豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字:Foldy Bird。美中不足的是,最终样式与真实 iPhone Duo 略有差异,倒是更像 Surface Duo。 从一颗星球到一座城堡,再到一台能折叠的手机,小王子的家算是安顿好了。这一路上,豆包 2.1 Pro 接收的信息不只有文字,还有设计图和视频。它必须去看,并且看懂,才能真正开始动手去创作。 小王子的故事先讲到这里,现在回到我们的日常生活。 从星球回到地面,只需一张图,豆包能盖房 现实中需求,往往就是一张图:一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。 先从一张建筑平面设计图开始,我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里,模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说,这类任务很难仅靠文字推理完成。 视频链接:https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeM

about image

订阅我们的时事通讯并获取最新消息