炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
这项由Google DeepMind主导的研究于2026年7月28日以预印本形式发布,论文编号为arXiv:2607.25537v1,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。
说到提示词,大多数人脑海中浮现的画面大概是这样的:在聊天框里敲入一段精心措辞的文字,然后期待AI给出更好的答案。过去几年,围绕如何"好好跟AI说话"的研究已经发展成了一门独立的学问,甚至有人专门以此谋生。但Google DeepMind的研究团队最近提出了一个颇为新鲜的问题:如果说文字提示词可以被精心设计,那么图片提示词是不是也可以?
这个问题背后,藏着一个已经悄然发生的技术转变。过去一年多时间里,一类被称为"视频生成模型"的AI系统正在悄然升级为通用的视觉推理工具。这些模型不仅能生成好看的视频,还能通过"演示"来解决问题——给它一张迷宫的图片,它能生成一段小球走出迷宫的视频;给它一道物理题的示意图,它能用动画展示球会滚进哪个桶。这类模型接收两样东西作为输入:一段文字说明(描述接下来要发生什么),以及一张图片(作为视频的第一帧)。研究者们一直在努力优化前者,却几乎从未认真打量过后者。
Google DeepMind的团队决定填补这个空白。他们将这套方法命名为VIPE,也就是"视觉提示工程"(Visual Prompt Engineering)。核心思路其实并不复杂:在把图片喂给视频模型之前,先用图像编辑模型对这张图片动动手脚——不改变题目本身,只改变它的视觉呈现方式。一道原本用素描风格画出的物理题,可以被改造成摆满实木架子和台球的逼真场景;一组抽象符号,可以被渲染成立体的3D实物。
结论相当出人意料:仅仅改变图片的视觉风格,不改任何题目内容,视频模型的答题正确率就能大幅提升。在某些任务上,这种纯粹的"换衣服"操作带来的性能提升,甚至超过了让模型反复尝试同一道题二十次的效果。
一、为什么给AI"换一身行头"这件事有意义
在正式展开研究细节之前,有必要先理解这件事为什么值得做。
考虑这样一个场景:你想测试一条鱼的游泳速度,但你把它放在了一块旱地上。测试结果当然很糟糕,但这个糟糕的结果反映的不是鱼的真实游泳能力,而是测试环境的不匹配。这个听起来有些荒唐的比喻,恰恰是Google DeepMind研究团队在这项工作中的核心发现:视频生成模型在抽象、草图风格的图片上表现糟糕,并不一定意味着它们推理能力差,而可能只是因为它们被放在了"旱地上"。
视频生成模型是用海量真实世界视频训练出来的。它们最熟悉的是真实场景里的光影、质感、物理运动方式。当你给它们一张黑白线条草图,让它们预测一个白色圆圈会滚进哪个线条画的容器里,它们其实是在一种陌生的视觉语言下工作。结果自然不理想。
这个观察引出了研究的核心假设:如果把草图变成逼真的照片风格,让那个白色圆圈变成一颗真实的台球,让那些线条变成实木货架,视频模型会不会表现得更好?答案是肯定的。
这种现象被研究团队称为"现实主义偏好"——视频模型天然偏好在写实场景中推理,而这恰恰给视觉提示工程留出了可操作的空间。
二、实验是怎么做的
研究团队搭建了一套完整的流水线,分为三个步骤,各司其职。
第一步叫做"构想者"。这个角色的任务是想出如何修改图片。在自动化实验中,研究团队用一个大型语言模型(具体是Gemini 3.1 Pro)来担任这个角色。它会查看原始图片,然后用文字描述一种新的视觉风格——比如"把这张草图变成一个真实的台球滚落木制货架的场景"。关键约束是:题目的逻辑结构必须完整保留,障碍物的数量、位置、角度都不能变,只有视觉呈现方式可以改。
第二步叫做"编辑者"。它负责按照第一步的指令,真正动手改图片。研究团队在实验中使用了Nano Banana Pro(本质上是Gemini的图像生成模块)来完成这个工作。对于同一张图片,编辑者会生成多个候选版本,默认是五个。
第三步叫做"过滤器",是可选的。当编辑者产出了多个候选图片后,过滤器负责从中挑出质量最好、与原图逻辑最吻合的那一个。这个角色同样由Gemini 3.1 Pro担任,它会仔细比对编辑前后的图片,确保题目本身没有被意外改变。
完成这三步之后,改造好的图片才被送给视频模型,视频模型生成一段演示视频,最后由一个"裁判"(自动评分模块)判断答案是否正确。
整个流程的设计理念是:始终对题目的逻辑内容保持零干扰,只在视觉表现层面做文章。就像把同一道数学题从手写板书抄到打印稿上——题目没变,但读者的阅读体验变了。
三、用一道经典物理题检验效果
研究团队选择的第一个测试场景是一个叫做VPCT的数据集。这个数据集的设定很直观:屏幕上有一张草图,一个白色圆圈从顶端出发,沿着几条斜线(代表障碍物)往下滑落,最终落入底部三个容器之一。题目要求预测圆圈会落入哪个容器。
原始版本完全是抽象的线条画风格,黑色线条代表障碍物,白色圆圈代表球,没有任何质感、光影或真实物体的特征。经过视觉提示工程处理后,同样的场景被渲染成了逼真的照片:白色圆圈变成了红色台球,黑色线条变成了实木搁板,整个场景看起来就像一个真实存在的台球滚落展架的实验装置。
研究团队用多个视频模型测试了这个改变的效果,结果相当显著。以开源模型Wan2.2为例,在原始草图条件下,它的正确率接近随机猜测水平(随机猜测三选一的概率是33.3%),英文提示版本的正确率只有32.4%。换成逼真图片后,同一个模型的正确率稳定地超过了随机水平,达到40%以上。对于Google自家的Veo 3.1模型,改变更加明显:原始草图下正确率是41.3%,换成逼真图片后直接跳升到59.3%,提升了整整18个百分点。另一个模型Omni Flash则从56.3%上升到67.5%。
为了验证真正起作用的是"写实感"而非"立体感",研究团队还专门做了一组对照实验:他们制作了一批看起来有立体感但纹理完全不真实(比如棋盘格纹理、荧光色拼接)的图片。结果几乎所有模型在这种"假3D"条件下的表现,与原始草图相比没有显著差异。这说明让模型变聪明的不是3D效果本身,而是真实材质、真实光影带来的写实感。
四、让机器自动找到最好的"视觉外衣"
手动设计一套合适的图片改造方案是可行的,但这需要人对模型有一定的了解,也比较费时。更理想的情况是让整个过程自动完成。研究团队测试了两种不同的自动化策略。
第一种策略叫做"自由发挥构想"。简单说,就是让一个AI(Gemini 3.1 Pro)在没有任何预设框架的情况下,自由地为每个任务想出新的视觉呈现方案。为了保证多样性,每次生成新方案时,AI都能看到之前已经提出过的所有方案,从而避免重复。研究团队对六个不同的视觉推理任务各自生成了20种不同的图片变体,再用这些变体测试Veo 3.1的表现。
实验覆盖的任务包括:上文提到的物理滚球预测(VPCT)、四种不同难度的迷宫求解(从5×5的简单方格迷宫到形状不规则的复杂迷宫)、停车场解谜(RushHour,需要移动挡路的车辆让目标车辆出场)、视觉搜索(在一堆干扰物中找出两个符合特定颜色和形状条件的目标)、数字排序(让数字按从小到大的顺序逐一消失),以及连点成线(用线连接颜色相同的两个圆点)。
在这些任务上,自动生成的视觉变体带来的错误减少率非常可观。以数字排序任务为例,最好的一个图片变体让错误率降低了70%。停车场解谜的某些变体让错误率降低了75%。迷宫求解在某些难度级别上也取得了超过40%的错误减少率。不同的任务有不同的"最优视觉风格"——停车场解谜在被改造成"阳极氧化铝金属拼图盒"风格时表现最好,而迷宫在被渲染成"街机游戏屏幕截图"风格(画面有细微的像素纹理)时效果最佳。
第二种策略叫做"逐步概念编辑"(ACE)。与第一种策略的"整体换风格"不同,这种方法更像是一个外科医生:每次只改变图片中的一个元素,比如换掉背景颜色,或者给数字加上边框,然后观察效果,再决定下一步改什么。整个探索过程像一棵树:从原始图片出发,每一次编辑都是一个分支,效果好的分支继续延伸,效果差的分支剪掉。
ACE方法还有一个重要特点:它能从实验结果中总结出规律,形成所谓的"规程",然后用这套规程指导后续的搜索。比如对于数字排序任务,模型总结出了几条反复奏效的原则:高对比度的深色背景能帮助模型聚焦在前景元素上;给每个数字加上几何边框能增强视觉定位;把平面元素改成有质感的3D风格(比如黑板粉笔字)能提升物体在时间维度上的稳定性。研究团队特别指出,这些有效策略往往需要组合使用才能发挥最大效果,单独使用任何一个效果都更有限。
相比之下,被反复证明无效甚至有害的操作包括:给物体添加高反光的金属材质(因为这种材质会在视频帧之间引入不稳定的光影变化)、过度加粗字体(会让数字边界模糊)、以及把颜色调得过于鲜艳饱和(反而会分散模型的注意力)。
两种策略各有优劣。自由发挥构想更省计算资源,适合快速探索;逐步概念编辑更精细,在某些困难任务上能找到更好的单样本解决方案。数字排序任务在ACE方法下甚至达到了100%的错误减少率。
五、视觉提示工程与其他提升策略的横向比较
研究团队不仅测试了视觉提示工程本身的效果,还把它与另外两种常见的性能提升策略进行了直接比较:反复生成视频然后投票(也叫"自洽性"方法),以及直接改写文字提示词。
先看与反复生成的比较。这种策略的逻辑是:同一道题生成多个答案,然后用多数票决定最终答案,就像让多个陪审员独立投票一样。研究团队在VPCT任务上让Veo 3.1反复生成20次并投票,正确率从41.3%上升到50%,提升了大约8.7个百分点。而使用一次视觉提示工程处理过的图片,仅用单次生成就已经达到59.3%,比20次反复生成还高出将近10个百分点。
更有趣的是,这两种策略并不互斥,可以叠加使用。在改造过的逼真图片上再做20次投票,最终正确率达到了68%,比原始草图加20次投票(50%)高出18个百分点。
从成本角度看,这种比较更加鲜明。生成一段8秒的视频需要大约3.2美元,而完成一次视觉提示工程(包含5个候选图片的生成和过滤)只需要大约0.4美元,不到视频生成费用的八分之一。这意味着在相同的预算下,把钱花在探索更多视觉变体上,比把钱花在生成更多视频上效率更高。研究数据显示,对于同等预算,最优策略通常是尽可能多地探索不同的视觉变体,每个变体只生成一次视频,而不是针对同一个视觉变体反复生成。
再看与文字提示工程的比较。研究团队用同样的自动化框架,分别生成了20个图片变体和20个文字提示变体,在四个任务上进行了直接对比。结论是:两种策略都有效,但视觉提示工程在多数任务上表现更好。以视觉搜索任务为例,最好的图片变体让正确率从4%跳升到62%,而最好的文字变体只能达到12%。数字排序任务上,最好的图片变体达到76%,最好的文字变体达到86%,这是少数几个文字策略更优的案例之一。
值得一提的是,研究团队还尝试了同时修改图片和文字的联合优化,但结果没有比单独修改图片更好。研究者推测,这可能是因为联合优化增加了搜索难度,生成的方案反而不如专注于单一维度精雕细琢来得有效。
六、视频模型为什么喜欢真实感
现在回到最根本的问题:为什么视觉提示工程会有效?研究团队通过一个精心设计的实验给出了直观的解释。
他们创建了一个逐步递进的视觉改造序列,从一个纯粹抽象的合成场景出发,每次只往"真实"方向走一小步。起点是两个彩色圆点和两条虚线,代表两个物体沿各自路径移动到交汇点。第一步改造:把虚线换成铁路轨道,但圆点保持不变。第二步:把圆点换成火车车厢模型,但背景仍然是白色。第三步:加上真实的绿色草地背景,整个场景看起来就像一段真实的俯拍铁路视频。
在每个阶段,研究团队都让Veo 3.1生成100段视频,然后由真人评估员判断生成的视频是否"场景连贯"(即物体没有凭空消失、没有随机变形、没有莫名其妙地改变外观)。结果沿着这条改造路径单调递增:纯抽象场景的连贯性得分是0%,加上铁路轨道后是11%,换上火车车厢后是24%,加上真实草地背景后是59%。每一小步朝真实感迈进,都直接对应着视频模型生成质量的提升。
这个结果指向一个清晰的机制:在真实场景中,视频模型"知道"物体应该怎么运动,因为这类场景在训练数据里出现过无数次,物理规律是隐含在训练记忆里的。但在抽象场景中,模型没有足够的"记忆"可以依赖,只能靠"猜",而猜出来的结果往往是物体随机出现、消失或变形——这对任何需要追踪物体状态的推理任务都是致命的干扰。视觉提示工程的本质,就是把任务从模型陌生的视觉语言翻译到模型熟悉的视觉语言。
七、这套方法并非对所有AI模型都适用
研究团队还做了一组补充实验,测试视觉提示工程是否同样能提升图像生成模型的推理能力。他们选用了两个版本的Nano Banana(Gemini系列的图像生成模块),让这些模型直接从VPCT的图片预测球会落入哪个桶,答案可以是一张图片(画出球落入某个桶的场景),也可以是一段文字(直接说"左边"、"中间"或"右边")。
结果出现了一个有趣的分化。对于图像生成模型,视觉提示工程带来的提升要么微弱,要么甚至是负面的。Nano Banana Flash在图像输出模式下,换用逼真图片后正确率反而从37%下降到21%。但同一个模型切换到文字输出模式,在原始草图上的正确率就达到了58%。
这个结果揭示了一个重要的区别:图像生成模型在训练中接触过各种风格的图片,包括抽象风格和写实风格,因此对它们来说抽象草图并不陌生,视觉提示工程的"翻译价值"就要小得多。而视频模型的训练数据几乎清一色是真实世界的视频,抽象草图对它们而言是真正陌生的领域。视觉提示工程能发挥作用,正是因为它弥补了输入格式与模型训练分布之间的那道鸿沟。当那道鸿沟本来就不存在时,VIPE自然也就无用武之地。
此外,研究团队还发现了一个值得关注的现象:虽然Gemini 3.1 Pro作为纯文字视觉问答模型,在VPCT原始数据集上能达到96%的超高正确率,但当研究团队把桶翻转过来倒置时,正确率立刻崩溃到4%。更关键的是,这个模型能准确识别出桶是倒置的,但仍然会告诉你球会"落入"某个倒置的桶——它理解视觉信息,却无法把这个信息与物理常识正确结合。这说明当前的视觉语言模型在VPCT上的高分,很可能来自某种视觉统计捷径,而非真正的物理推理能力。
八、研究者留给整个领域的建议
基于上述发现,研究团队提出了一个在学术评估层面颇具实践意义的建议:在用视觉推理基准评测视频模型时,如果评测集本身是抽象的、非写实的,那么测出来的成绩往往只是模型真实能力的下限,而非真实水平。就像不能用让鱼在陆地上爬行的测试来评估鱼的运动能力一样,用抽象草图来评估视频模型的推理能力,本质上是在用错误的测试环境得出偏低的结论。
研究团队建议:只要技术条件允许,评测者应该主动用视觉提示工程把抽象测试场景转化为写实场景,然后再测试模型能力。这样得到的结果才能更真实地反映模型的内在推理潜力。当然,研究团队也坦承,模型对视觉风格如此敏感本身就是一个需要被修正的问题——理想中的模型应该能够在任何视觉风格下都表现稳定,不需要用户帮它"换衣服"才能正常工作。这与早期语言模型对措辞高度敏感的问题如出一辙,当年人们发现"Obama worked as a ___"和"Obama is a ___ by profession"会得到截然不同的填充结果,如今类似的敏感性正在视觉模态上重演。
归根结底,这项研究想传递的信息并不复杂:对于当前的视频生成模型,你给它看的图片长什么样,会极大地影响它能解出多少题。这个发现既是一个可以立即利用的实践技巧,也是一个提醒——在我们庆祝AI推理能力取得新高分之前,也许应该先问一句:这个高分是在"陆地上"测出来的,还是"水里"测出来的?
Q&A
Q1:视觉提示工程(VIPE)具体是怎么改变图片的,会不会改变题目本身?
A:VIPE的核心原则是只改视觉风格,不改题目逻辑。举个例子,原来的物理题里有一个白色圆圈和几条黑色斜线,VIPE会把圆圈改成真实的红色台球,把斜线改成实木货架,但障碍物的数量、角度、位置完全不变。题目依然是那道题,只是看起来更真实了。整个过程会有一个过滤步骤,由AI(Gemini 3.1 Pro)仔细核查改造前后是否有逻辑变化,确保题目没有被意外修改。
Q2:视觉提示工程和多次重复生成视频相比,哪种更划算?
A:视觉提示工程更划算。以VPCT物理推理任务为例,生成一段8秒视频约需3.2美元,而完成一次包含5个候选图片的视觉提示工程只需约0.4美元,不到视频生成费用的八分之一。实验数据显示,在相同预算下,把钱花在探索更多不同的视觉变体上,比反复生成同一张图片的视频效率更高。当然两种方法也可以叠加使用,效果会进一步提升。
Q3:视频模型为什么在写实图片上表现更好,在草图上表现更差?
A:视频模型是用海量真实世界视频训练出来的,它的"记忆"里充满了真实场景里物体的运动规律。当它面对写实图片时,能调用这些记忆预测物体怎么动;面对抽象草图时,它没有足够的参考,只能乱猜,结果就是视频里物体随机消失、变形,根本没法正确推理。研究团队通过实验证实,每向真实感迈进一小步,模型生成的视频连贯性就会明显提升,从0%一路升到59%。