
本站推荐电影
本站推荐电视剧
电影下载排行
电视剧下载排行

A |

B | 而视频生成公司的展台就设在机器人公司隔壁,播放演示片的屏幕连成片:机械臂倒水,无人机穿林,虚拟角色转身。

C | 不同公司的讲解员说着高度趋同的话:都在讲具身智能,都在讲世界模型。

D | 图:WAIC 2026 现场,宇树科技展台(来源:新蓝网) 穿梭在展台之间的投资人,面对诸多公司同样问着高度趋同的一套问题,核心聚焦在模型到底什么水平。但得到的答案却分别指向不同的东西。

E | 媒体圈的问题则更清晰、直白,当“世界模型公司”越来越多,到底该怎么看谁更强? 然而时至今日,世界模型依旧没有一个统一的定义和衡量标准。

F |

G | 2023年7月,新加坡交通部长易华仁因涉嫌贪腐和利益冲突被逮捕,成为该国近40年以来,第一个因贪污落马的内阁成员。 在 VBench 1.0 认证榜中,头部模型集中在 84 分到 88 分之间,差距已经很小。于是 VBench 在 2025 年推出 2.0 版本,将评测范围扩展到人类保真、物理、可控性、常识等维度,开始关注那些决定真实感、却容易被忽略的问题。

H | 画面可以逼真,模型却未必理解画面背后的规律。 WorldModelBench:回答"懂不懂" 如果视频生成模型被称为“世界模型”,它就需要接受更严格的检验。外界曾预测,新加坡可能将于今年提前举行大选,以增强黄循财执政的合法性,并利用人民行动党在今年11月21日建党70周年的窗口时机,来推高支持率。 2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的研究者推出 WorldModelBench,把模型放进物理和常识环境中测试。 该评测覆盖机器人、驾驶、工业、人类活动等 7 大领域,包含 350 条提示词和 6.7 万条人工标注,从指令遵循、物理规律、常识三个维度打分。

I | 结果显示,即使表现最好的模型,也只有 61% 的视频正确完成指令;12% 的视频违反质量守恒,11% 出现物体互相穿透。

J | 模型能生成一个看起来合理的世界,但距离真正理解世界,还有明显距离。

K | 这类预测如果不准,后面的规划和执行都无从谈起。 测量这一底座能力的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 联合推出,论文发表于 WACV 2026。 2026 年 6 月,原团队联合 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。在贸工部、财政部、教育部等至少8个政府部门,有过丰富任职经历的黄循财,长期习惯于在幕后工作,以致后来曝光率提升后,还被媒体认为是“名不见经传的小公务员”。

L |

M | 它的设计与前述榜单都不同:研究者真实拍摄了 66 个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验 3 个机位、实拍 2 次,共 396 段 8 秒视频。

N | 4 项指标合成一个 0 到 100 的 Physics-IQ 分数,并用同一场景两次实拍之间的差异做归一化:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来和这种自然波动比较。

o | 这也正是图灵奖得主 Yann LeCun 多年来反复主张的观点,“AI 需要建立关于世界的内部模型,而不是只会生成内容”。

p | 他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 当作核心评测基准。

q | 然而翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。 2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。当时的榜首、Google 的 VideoPoet 只有 29.5%,Magi-1 几乎把这个数字翻了一倍。

r | 从那天算起,Magi-1 系在第一名的位置上坐了约 13 个月,中间只离开过三周。 这张表有三种读法。 看裸模型:前三名里有两个建立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模型最高分,远高于 Sora 2 裸模型的 42.3%,Cosmos3-Super 裸模型的 59.7% 出自不同设定,两者不直接可比。

s | 看增强系统:2026 年 5 月,英伟达最新发布的旗舰世界模型 Cosmos3-Super 加持 WMReward 后冲到 63.4%,短暂登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。

t | 图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模型 42.3%(来源:physics-iq.github.io,2026 年 7 月截图) 再看修正后的新榜:2026 年 6 月发布的 Verified 版本上,Magi-1 24B 增强版 58.2 分排第一、裸模型 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 只有 26.5 分。 图:Physics-IQ Verified 修正榜(来源:physics-iq-verified.anates.ai,2026 年 7 月截图) 把两张榜单放在一起看,会出现一个反常识的画面。OpenAI 的 Sora 在 VBench 这类回答"像不像"的榜单上名次并不难看,到了 Physics-IQ 上,Sora 2 裸模型只有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上只有 26.5 分,不及榜首 58.2 分的一半。 生成得逼真,和预测得准确,被证明是两回事。 把视频生成做成"预测下一个词" Magi-1 赢在哪里?论文给出的答案是架构选择。

u | ”吕元礼对南风窗表示。

v |

w | LeCun 在 2022 年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出 JEPA 架构:不在像素空间预测世界,而在表征空间预测,主动忽略那些不可预测的细节。《经济学人》的评价或许更为形象:“他也是那种你会想一起喝啤酒的男人。这条路线后来长成一个家族:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频训练,其衍生版本可以做零样本的机器人规划。

x | ”

y |

z | 开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。

| 此外,上任领导人物色的人选需要得到同侪的推举,同代成员的意愿体现同样重要。

| 竞争的坐标系确实在平移。

| 过去几年,视频模型的发布会比的是"像不像":分辨率、时长、美学分。Physics-IQ 这类榜单的出现,把问题换成了"物理世界变化预测的准不准"。

| ”

| 这些东西没法靠话术修饰。

| 榜单会迭代,名次会更替。但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。 尺子一旦有了,量出什么,就是什么。
Current article:http://q8gg5xf.qiniaohongfangfoguisenzhai.cyou/0ido3/20260826/11513.html
Published on:03:38:39