速递|Agnes三大新模型发布前瞻,文本、图像、视频跑分公布
创始人
2026-06-27 13:26:44
0次

来源:Z Potentials

AI 圈的牌桌上,没人能歇。

最近,Agnes又推出了三个新的大模型,评测结果也曝光。从文本、图片到视频,Agnes 这一次全线更新。

废话不多说,我们直接看这次流出的核心信息。

01 视频模型Agnes-video-2.5-preview:重点提升运动、物理与镜头一致性

在VBench综合得分中,Agnes-video-2.5-preview获得59.94分。作为参照,Veo3在该榜单的综合得分为63.23。

在具体的5项细分维度中,Agnes-video-2.5-preview在运镜一致性方面表现最突出,得分52.72,超过Veo 3。据悉,该模型在训练时便着重强化了镜头语言的训练,新模型能精准解析“缓慢推近”、“低角度环绕”等专业术语,且在运镜时减少主体崩坏。

物理规律上,Agnes 以78.82的评测分数逼近Veo 3表现。刚体动力学合规,抛物线、流体(水烟火尘)的真实湍流、碰撞反馈、以及光影在全片中的光学一致性较前代模型都有提升。

人物一致性、动作一致性和情境一致性分数上,Agnes也都非常接近Veo 3。

除了榜单表现的5个纬度,这一代视频模型在画面与人物多样性、动漫与特效、多参考图生视频/生图方面也做了提升。

02图像模型Agnes-image-2.5-preview:进入综合生成能力评测前列

在Qwen Image Bench榜单上,Agnes-image-2.5-preview整体得分57.53,高于Seedream4.5和Seedream4.0。分数更高的,几乎都是出名的大厂顶尖型号,如GPT Image 2、Nano Banana 2.0、GPT Image 1.5、Nano Banana Pro、Qwen Image 2.0 Pro、Seedream 5.0等。

Qwen Image Bench的评测维度包括Quality、Aesthetics、Alignment、Real-world Fidelity 和 Creative Generation五个维度。相比只看“画面是否好看”,这类评测更关注模型是否能稳定完成真实创作任务。

Quality(图像基础质量):关注图像的清晰度、自然度、材质纹理、物理逻辑等技术合格度。

Aesthetics(审美表现):考察构图、色彩和谐、光影氛围、风格控制等视觉舒适度。

Alignment(提示词遵循):评估是否准确按照提示词生成属性、数量、位置、关系等内容。

Real-world Fidelity(事实细节精准度):关注对现实知识、文化、历史和社会规则的还原,避免刻板印象等。

Creative Generation(创意生成):考察复杂设计、文字渲染、视觉叙事、想象力融合等专业创作能力。

5个核心纬度上,Agnes-image-2.5-preview在Quality 维度得分 54.90,Aesthetics得分59.05,Alignment得分58.40,Real-world Fidelity得分51.95,Creative Generation得分63.35,分数非常均衡。

从分项结果看,Agnes-image-2.5-preview 在Creative Generation上相对更突出。这意味着它不仅关注单张图像是否美观,也在复杂设计、视觉叙事、多元素组合和创作型任务,也就是在“专业创作能力”中有一定表现。

03 文本模型Agnes-2.1-preview:鲁棒性更强,多轮对话大进化

在Claw-eval 榜单中,Agnes 的全新文本模型Agnes-2.1-preview经过多轮评测获得61.6%的综合得分。

Agnes-2.1-preview 的变化主要体现在两个方面:一是单轮任务完成度更高,二是在多轮任务中的鲁棒性有所增强。这对于 Agent 类应用比较关键,因为真实任务往往不是一次问答结束,而是需要模型持续理解目标、调用工具、调整路径并完成最终交付。

Claw-eval多轮评测的具体数据如下(judge model为Gemini_3_flash_preview,Trials per task每任务尝试3次,Denominator tasks总任务38个):

根据目前公布的信息,Agnes-video-2.5-preview与Agnes-image-2.5-preview预计将于下周正式上线,开发者届时即可通过官网 API 调用;文本模型Agnes-2.1-preview的发布时间预计也不会太远。

与此同时Agnes的实际使用规模也在持续刷新纪录。据Agnes AI官方最新公布的数据,截至目前,Agnes 全模态模型单周调用量达到4.66万亿(4.66T)Token,再创历史新高。其中,文本模型调用量达2.80T,多模态模型(图片、视频等)调用量达1.86T 。

这组数据意味着,Agnes已不仅仅是跑出不错的评测成绩,而是真正承载着海量真实用户和开发者的生产级调用。尤其是接近2T Token的多模态调用量,也说明图片、视频等生成能力正在进入越来越多真实创作、开发和商业场景,在保持低成本甚至免费的前提下,用户愿意持续、大规模地使用这些模型完成实际工作。

值得一提的是,Agnes即将发布的新一代文本、图片和视频模型,上线后仍将继续保持免费开放。对开发者和创作者而言,这意味着无需因为模型升级而增加使用门槛,可以第一时间体验最新能力,并继续放心"烧 Token"、构建自己的AI应用。

特别声明:以上内容仅代表作者本人的观点或立场,不代表Hehson财经头条的观点或立场。如因作品内容、版权或其他问题需要与Hehson财经头条联系的,请于上述内容发布后的30天内进行。

相关内容

中国雪中送炭,好心帮欧洲熬...
深秋的凉意初来,我望着窗外飘落的枯叶,心头涌起一股复杂的情绪。最近...
2026-10-02 12:00:05
马斯克点名全球缺电,唯独放...
一场全球范围的能源危机,悄然逼近。不久前,马斯克在G20创新部长级...
2026-10-02 11:59:33
未来电费要免费?中国“人造...
能源几乎贯穿了现代工业发展的全部过程。煤炭推动蒸汽时代,石油改变交...
2026-10-02 11:09:04
中国两次雪中送炭,好心帮欧...
►在这里,听见中国走向世界的号角最近这几个月,全球地缘政治的牌局打...
2026-10-02 11:08:38
持有人民币的国人留意:咱们...
人民币的分量,正在被全世界重新掂量一遍。过去聊汇率,大家习惯抬头看...
2026-10-02 11:08:32
河南产褥垫选购怎么参考本地...
河南母婴日用消费市场基本概况河南作为人口大省,母婴类民生消费需求始...
2026-10-02 10:09:04
10月1日:人民币走强!现...
中午去菜市场,排骨摊前犹豫了三秒,最后还是把两兜排骨和一袋鲜虾一起...
2026-10-02 10:08:53
美团外卖单量断崖式下滑!骑...
一杯奶茶重新卖回十七八块,一份工作餐动辄三十开外——这个夏天过去,...
2026-10-02 09:09:59
弄清中国的消费数据
(来源:安策智库)这是一篇探讨中国消费数据的研究型文章。消费很重要...
2026-10-02 09:08:41

热门资讯

欧盟多花了1000亿欧元,却没... 9月29日,爱尔兰首都都柏林,欧盟能源部长们坐到了一起。欧盟能源专员丹·约根森在会上说了一句话,把在...
储户注意!银行开始挑客了:存2... 存二十万的门槛过去只是一道数字关,如今却成了银行给客户"排座位"的起跑线。同样的额度、同样的三年期、...
217家机构,547次调研,中... 自打7月以来科技板块大幅调整,全A中位数一言难尽,散户在割肉,游资在撤退,连财经大V们都安静了不少。...
中国民企排名大洗牌:美的止步前... 一家年营收4585亿元的家电巨头,只能排到第13;一家刚刚跨过万亿门槛的互联网龙头,也只能屈居第二。...
美财长称中伊石油两周清空?看懂... 九月初的阳光依然炙热,但美国财政部长贝森特的那番话,却像一盆冷水泼向了国际局势。他斩钉截铁地宣称,伊...
从“托市场”到“托家庭”,房贷... 9月29日,财政部会同中国人民银行、金融监管总局印发《关于实施居民购房贷款贴息政策的通知》,明确自2...
10万亿!中国或将成为全球,甚... 10万亿千瓦时。这个数字挂在纸面上很轻,落到现实里却重得吓人。2025年,中国全社会用电量最终定格在...
手握人民币的国人请注意:我们的... 前几天有个朋友跟我吐槽,说他去年年底咬牙换了一笔美元,本想着"避险",结果放到现在一算账,不但没赚,...
发现没?人民币变“金贵”了!今... 9月下旬,国内金融市场出现了一组非常罕见的信号。一方面是银行存款利率下调,另一方面则是人民币对主要外...
被年轻人挤爆的“山姆平替”,为... 来源|深氪新消费 鼠桃桃在人潮汹涌的长沙南站,经常能看到行色匆匆的旅客,手上提着同款白色购物袋。蓝红...