英伟达团队发布最新具身模型 Cosmos

来源:风台秀发布时间：2025-09-09 17:33:07

英伟达 GTC 大会热度飙升。英伟继黄仁勋在英伟达大会上发布基础世界模型 Cosmos 引发业内讨论后，达团队英伟达团队近日又发布了一个新的布最物理世界大模型：Cosmos-Reason1。

作为 Cosmos 系列的新具型一个大模型，顾名思义，身模Cosmos-Reason1 更强调模型的英伟长沙师范大学爆料排名“Reason”（即“推理”）能力。这是达团队继 DeepSeek R1 采用纯强化学习方法替代 SFT 之后，思考推理模型在物理世界中的布最进一步探索；且据论文介绍，其取得了不错的新具型成果。

英伟达团队发布最新具身模型 Cosmos-Reason1，身模在物理世界推理中碾压 Qwen、英伟GPT-4o 等多个 VLM 模型

论文地址：https://arxiv.org/abs/2503.15558

与 DeepSeek 跑在云端不同，Cosmos-Reason1 致力于解决的布最是机器智能系统与物理世界交互的问题——这要求跑在物理世界中的 AI 大模型要同时具备感知、理解与执行复杂动作的新具型三个基本能力，即当前具身智能领域主流的身模研究热词“VLA”，或“具身大脑”。

根据论文介绍，Cosmos-Reason1 可以理解物理世界，并通过长思维链（Long CoT）的杭州高中偷拍视频下载推理过程在自然语言中生成适当的行为决策。在这个思路上，英伟达的研究团队开发两个多模态大模型，分别是 80 亿参数的 Cosmos-Reason1-8B 和 560 亿参数的 Cosmos-Reason1-56B。

他们分四个阶段来进行信息收集与模型训练，分别是：视觉预训练、通用 SFT、物理 AI SFT、以及物理 AI 强化学习后训练。为了评估模型效果，他们分别在物理常识与具身推理两个方向上制定了 Benchmark，并取得了不错的表现。

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

Cosmos-Reason1 工艺路线图概览

当前 Cosmos-Reason1 已开源，具身智能先锋研究者宋舒然等人也参与其中。

物理世界的 AGI 有何不同？

业内一直有观点认为，AGI 的增长会天然地分为云端 AGI 与端侧 AGI，物理世界中的 AGI 即属于后者。

但相比云端 AGI 模型（如 DeepSeek R1 等），能够与物理世界进行有效交互的 AGI 却突破缓慢，因其难度更大，不仅要具备云端 AGI 的理解、推理能力，还需要感知、决策。即使是推理环节，云端大模型的训练主要基于互联网上的大量文本信息，也难以迁移到与物理世界的互动知识中。

物理世界中的 AGI 需要具备什么能力？

英伟达团队认为，与设计擅长解决编码和数学问题的大模型不同，物理世界的大模型应该具备物理世界常识与基于物理世界的具体推理能力。这包含两方面：

一是物理常识应分为三个主要类别：空间、时间和基础物理，同时这三个类别又会被进一步划分为 16 个细粒度的子类别。这关乎到物理世界如何在物理定律下运行，以及 AI 如何与物理世界进行交互；

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

图注：物理常识的 16 个子类别，空间包含关系、合理性、可供性与环境；时间包含规划、相机、因果、指令、行为；基础物理包括反重力、热力学、电磁、机械学、客体永恒性、状态、属性。

二是他们认为，要为具身推理引入一个二维的知识体系，其包含跨越 5 类具身智能体的 4 种关键推理能力。这样有助于 AI 智能体在物理世界中的理解与规划。

具体而言，具身推理需要具备以下能力：

处理复杂的感官输入。与处理清晰信息表示的符号推理不同，具身推理必须从原始的、往往不完整且模糊的感官输入中提取有意义的模式。

预测行动效果。行动会产生物理后果，有效的推理需要直观地掌握因果关系。AI 系统必须预测一个物体对力会有怎样的反应，一个机器人的身体将如何与周围环境相互作用，或者一辆车辆的移动将如何受到地形和物理规律的作用。

遵循物理约束。与通常涉及优化离散选择的抽象问题解决不同，具身推理必须考虑现实世界的物理因素，如惯性、摩擦力和材料属性。它要求 AI 生成在物理约束条件下可行的长期行动规划，以确保执行过程中的稳定性、效率和保障性。

从交互中学习。在物理 AI 中，行动不是孤立发生的；每一个动作或决策都会作用环境并产生反馈。具身推理必须基于这些交互不断更新其理解，使系统能够动态地改进其行为。

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

在这个过程中，Cosmos-Reason1 的目标之一是使多模态大模型生成更多符合物理世界要求的反应。在视觉世界中，模型对世界的理解会被表示为影片形式，然后通过影片输入感知、理解与推理物理世界，再用自然语言将模型的反应表达出来。他们采用的是纯解码的多模态大模型架构，以及混合的 Mamba-MLP-Transformer 架构。

值得注意的是，Transformer 架构此前一直被诟病虽然擅长长序列表达、但无法高效实现空间理解，而 Mamba 架构是典型的非 Transformer 架构，英伟达团队采用 Mamba 混合或许就是为了中和 Transformer 在物理世界大模型中的短板。

他们使用张量并行度为 4 来训练 Cosmos-Reason1-8B 模型，而 Cosmos-Reason1-56B 模型则使用张量并行度为 8 和流水线并行度为 2来进行训练，以支持更长的影片训练。

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

为了提高模型的通用能力，在信息采集上，英伟达团队一共采用了总计 120M 的图像、影片与交互信息用于信息预训练，8M 的图像和影片信息用于通用的 SFT。

在大模型的推理中，基于规则的、可验证的大规模奖励（即强化学习方法）对解决数学、编码问题起了很大的作用。受此启发，英伟达团队也在 Cosmos-Reason1 中使用了强化学习方法来训练模型在物理世界中的推理能力。

他们探索了两种多项选择题回答的奖励类型，一种是基于人工注释的 MCQ，另一种是受影片自监督学习的启发，自动生成基于影片信息结构的 MCQ，比如用打乱的时空影片补丁来解谜题、预测影片向前或向后观看的时间箭头等。

Cosmos-Reason1 的效果

为了测试 Cosmos-Reason1 的效果，英伟达团队制定了以下基准：

在物理常识上，他们制定了 3 个基准（空间、时间与基础物理），包含了来自 426 个影片中的 604 个问题。

在具身推理上，他们建立了 6 个基准测试、包含来自 600 个影片的 612 个问题，覆盖了包括人体、机械臂、人形机器人与自动驾驶等多个构型的物理具身。

他们将 Cosmos-Reason1 与其他的大模型进行了对比，结果如下：

在物理常识的基准上，Cosmos-Reason1-8B 与 56B 的效果都显著提升，尤其是 56B 的效果全面超过 Qwen2.5-VL-7B 与 72B、Gemini 2.0 Flash 与 GPT-4o，只稍逊于 OpenAI 的 o1：

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

在具身推理上，显著强于其他 VLM 模型，效果提升超 10%：

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

雷峰网(公众号：雷峰网)认为在直观物理上，他们的研究发现，许多主流的 VLM 大模型实际难以进行直观的物理推理。

为了测试模型的直观推理能力，他们为三个任务（时间箭头、空间谜题与物体持久性）中的每一个任务都策划了 100 个影片，并生成 100 个问题。

结果显示，现有的许多 VLM 模型在时间箭头与物理持久性的任务上表现不佳，GPT-4o 与 OpenAI o1 处理空间谜题比随机猜测强。但 Cosmos-Reason1-8B 在三个任务中都得到了显著改进：

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

时间箭头例子：

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

时间箭头例子：

英伟达团队发布最新具身模型 Cosmos-Reason1，在物理世界推理中碾压 Qwen、GPT-4o 等多个 VLM 模型

参考文献：https://arxiv.org/pdf/2503.15558

雷峰网原创文章，未经授权禁止转载。详情见转载须知。

返回资讯首页 >>

趣瓜

更多 >

马斯克因“百万美元抽奖”再面临诉讼
更新：2025-09-09 16:44
周口邵医生坠楼背后，羊水栓塞最高死亡率86%
更新：2025-09-09 15:36
日本广岛大学再次发现疑似未爆弹
更新：2025-09-09 15:11
特朗普：若欧盟不履行义务将对其征收35%的关税
更新：2025-09-09 14:54

短闻

更多 >

反诈指南之校园篇——必看！这些骗局专坑学生群体
来源：北京网络举报“付费内推”“月入过万”靠谱吗？“最后一包”“必出稀有卡”可信吗？“有内部指标”“花钱保录”安全吗？……让我们一起了解针对学生群体的常见骗局，筑牢网络“安全门”，不给违法犯罪分子留下 ...
“208万顶流”为何被“205万”卡喉？
近期，演员赵露思与经纪公司银河酷娱的长期合约纠纷持续发酵，事件因赵露思“抑郁期间解散剧组”“直播情绪失控”等争议行为引发舆论两极分化。凤凰网娱乐独家对话著名律师张起淮，试图抛开舆论场的喧嚣，回归事件本 ...
邮报：亚马尔卷入三角恋传闻，与阿根廷模特夜店亲吻
据每日邮报消息：亚马尔最近再次卷入情感绯闻。他被曝在一家俱乐部与24岁的阿根廷模特亲吻。这次传闻的起因是亚马尔在社交媒体上发布了一张照片，脸颊上有个显眼的红色唇印。随后，24岁的歌手尼基-妮可也晒出了 ...
美国总统特朗普：可能很快宣布美联储主席
来源：财联社财联社8月5日电，美国总统特朗普表示，许多美联储主席候选人非常优秀，沃什很好，哈塞特也非常不错，还有另外两位候选人，可能很快宣布美联储主席。相关新闻：财联社8月5日电，特朗普再次批评鲍威尔 ...
探访阅兵训练场：以科学训练方法提升阅兵训练质效
随着中国人民抗日战争暨世界反法西斯战争胜利80周年纪念日临近，纪念活动的整体安排备受关注，其中的阅兵环节更是关注焦点。今年阅兵活动的整体设计是怎样的呢？跟随记者一起去了解一下。总台记者李迎新：在京郊的 ...
暴雨+强对流双预警！这些地区需注意防范
8月5日10时，中央气象台继续发布暴雨橙色预警和强对流天气蓝色预警。暴雨橙色预警4省区部分地区有大暴雨广西广东局地特大暴雨中央气象台8月5日10时继续发布暴雨橙色预警：预计，8月5日14时至6日14 ...
媒体：周口医生坠亡，别让网曝滑向网暴
▲网络暴力，绝对不是解决问题、化解纠纷的方式。图/IC photo救死扶伤的医生，也有迈不过去的“鬼门关”。近日，“周口市第六人民医院妇产科主任邵某某因长期遭受网络暴力跳楼身亡”一事引发广泛关注。8月 ...
陈佩斯，又被坑了一把
七月下旬，延期一周后，71岁的陈佩斯，带着他的《戏台》来了。这部电影改编自同名话剧，是一部打磨了整整十年的作品。几百遍的舞台沉淀，如今搬上银幕，让更多观众看到这一出在民国背景下，强权与艺术对垒的荒诞喜 ...
近东救济工程处：加沙营养不良儿童数量急剧增加
当地时间20日，联合国近东救济工程处主任专员菲利普·拉扎里尼表示，自3月以来，近10万名五岁以下加沙儿童接受了近东救济工程处的调查。调查显示，目前加沙营养不良儿童的数量是3月时的三倍，加沙城儿童的营养 ...
降雨没有预报的那么大？回应来了
来源：北京青年报很多北京市民早上起来，发现雨没有昨天预报里的那么大。8月4日13时至5日7时全市平均降水量25.6毫米，最大降水量出现在密云上甸子182.8毫米；最大降水强度出现在平谷挂甲峪，8月5日 ...
又美又飒！吴艳妮领奖比心+美女亚军献吻，放话：我会归来
13秒15的成绩夺冠，吴艳妮并不满意，她坦言没有什么值得庆贺的。不过，毕竟这是全国田径锦标赛冠军，而且是真正聚齐现役所有中国女子100米栏顶尖选手的一次比赛。吴艳妮站上领奖台的时候还是非常开心的。站上 ...
洪水过后十天，跟着怀柔琉璃庙镇的村民回家
10天，26公里，一场洪水，把村庄和安置点分隔在两端。8月5日，怀柔城区一处安置点，停了一排大巴车，车旁排着长长的队，68岁的黄学生紧了紧身上的双肩包，妻子马继芹手里拎着一个手提的大编织袋。安置在这里 ...