{label:top}
首页 >> 热点> 正文

Agent 要被吃进大模型了

来源:热点发布时间:2025-09-09 17:35:15
浏览:31

今天凌晨,吃进奥特曼突然发文宣布推出自家最新的大模 o 系列模型:满血版 o3 和 o4-mini,同时表示这两款模型都可以自由调用 ChatGPT 里的吃进各种工具,包括但不限于图像生成、大模图像分析、吃进文件解释、大模电竞馆按摩技师私拍合集网络搜索、吃进Python。大模

总的吃进来说,就是大模比前一代的性能更强而且价格更低。

Agent 要被吃进大模型了

消息一出,马上就有网友晒出了两个模型的大模“小球测试”结果,并配文:“这确实是吃进迄今为止看到的最好的测试结果了。”

Agent 要被吃进大模型了

也有网友晒出了满血版 o3 和 o4-mini 在 HLM 基准的中的排名,其中 OpenAI 的吃进两款新模型仅用了几个小时的时间就稳稳的“盘”上了榜单前三,引得网友大呼震惊。警花下班后被全集

Agent 要被吃进大模型了

Agent 要被吃进大模型了

o3 与 o4 mini 全面进化

除了网友们的测评结果外,我们也来看一下 OpenAI 给出的两个模型的官方信息。

首先,o3 在多个基准测试中表现优异,包括 Codeforces、SWE-bench 和 MMMU 等,刷新了多项纪录。除此之外,o3 在应对复杂现实任务时,比 OpenAI o1 减少了 20% 的重大错误,尤其在编程、商业咨询和创意构思领的方面能力最为突出。

Agent 要被吃进大模型了

o4 mini 这边,别看它体量不大,但专为快速、高效的推理任务而设计,可以支持比 o3 更高的使用频率。

在数学、编程和视觉任务上的表现依然非常亮眼。在 2025 年 AIME 数学竞赛中,借助 Python 解释器的帮助,o4-mini 取得了99.5%的高分,几乎达到了该测试的满分水平。专家评估同样显示,它在非 STEM 任务以及信息科学领域的表现已经超越了 o3-mini。

Agent 要被吃进大模型了

此外,o3 和 o4-mini 首次实现了将图像直接融入思维链的能力,它们不仅“看得见”图像,更能“通过图像思考”。这带来了视觉与文本推理的全新融合方式,显著提升了它们在多模态任务中的表现。

关于这点,OpenAI 图像推理研究员 Jiahui Yu 发文称:“自最初推出 o 系列以来,“图像思考”始终是我们在感知领域的核心战略之一。早期发布的 o1 vision,曾为这一方向提供了初步的探索与预览;而如今,随着 o3 和 o4-mini 的发布,这一战略终于以更为成熟和完整的形式落地。多模态能力的持续演进,不仅推动了模型在理解世界方式上的跃升,也成为 OpenAI 实现 AGI 愿景中不可或缺的关键一环。”

Agent 要被吃进大模型了

模型性能毋庸置疑,而关于这两款模型可以自由调用 ChatGPT 里的各种工具的能力,OpenAI 首席研究官 Mark Chen 也发文表示:一旦推理模型学会了端到端地使用工具,它们就会变得更加强大,而最新的 o 系列模型正在“向未来迈出的质的一步”。

Agent 要被吃进大模型了

所谓“质的一步”,无非是将大模型的能力扩展到目前最火的 Agent 领域,值得一提的是,这已经不是 OpenAI 第一次向 Agent 领域进发了。

今年年初,OpenAI 接连推出 Operator 和 Deep Research 两个产物宣告向 Agent 进发,在此之前,他们还推出过一个类似于代办助手的 Agent 产物 —— ChatGPT tasks,来试了试水花。

而这次的满血版 o3 和 o4 mini 则是支持直接调用 ChatGPT 里的各种工具,从之前的“聪明大脑”直接进化为了“灵巧双手”。

有网友在试过了 o3 最新模型的调用能力后表示,模型帮他做了一些需要跨工具才能完成的工作,这让他感觉到了 Agent 给人们带来的便捷。

Agent 要被吃进大模型了

OpenAI 做 Agent,得天独厚

关于如何才能做出真正的 Agent,目前坊间的主流观点是:强化学习加基座模型。

但在 Agent 的实际研发中,大多数专注于 Agent 的公司并不具备自研基座模型的能力,能够组建强化学习团队的更是凤毛麟角。它们唯一的机会,往往在于依靠强悍的工程能力持续打磨产物体验,或通过差异化定位,探索某些功能层面的创新。

然而,由于缺乏底层模型的掌控权,这样的努力终究只是为自己在与大模型公司的赛道上争取些许缓冲时间。正因如此,那些具备训练基础模型能力的公司,在开发 Agent 时,往往能够实现事半功倍的效果,占据天然优势。

巧合的是,Deep Research 团队曾在多次访谈中强调,他们认为基于强化学习的端到端训练是当前 Agent 工艺变革的关键所在,原因在于强化学习能够有效突破传统 AI 系统在复杂场景中面临的灵活性不足和泛化能力受限的问题。

在此基础上,叠加 OpenAI 本身在基础模型上的强大优势,或许不久之后,Agent 就会被吃进 ChatGTP 的某个版本之中。

Agent 要被吃进大模型了

一位长期从事 Agent 方向的研究人员曾对 AI 科技评论表示:“用强化学习训练 Agent,本质上更像是将语言模型的能力在特定环境中进行定向强化和适配。也就是说,强化学习更多是在帮助语言模型在某一特定场景中“训得很好”。然而,目前许多学术研究仍停留在使用较基础的 base model 进行环境内训练,这样的工作即便做到极致,其成果也往往只是某个环境下的“特化版本”,难以实现跨环境的泛化能力,因此其实际意义和应用价值仍然有限。”

顺着这个点往下看,不难发现其实 OpenAI 已经同时掌握了基础模型和训练方式,拥有从底层能力到上层产物的完整控制权,也因此在定价方便拥有了更大的自主权。

例如,Deep Research 的 Agent 以每月 200 美金的价格对外订阅,全部收入可以留在体系内部,而那些依赖第三方模型的独立 Agent 团队,不仅受到 API 成本和模型性能波动的限制,在产物定价上也显得捉襟见肘。

“略知皮毛”不如洞彻本质,“套壳”并不是长久之计,这么一看,OpenAI 做 Agent,就得天独厚。

开源 Codex CLI

新模型之外,OpenAI 还开源了一款本地代码智能体:Codex CLI。它是一个轻量级的编码助手,可直接在客户的终端命令行中运行,为的是充分发挥 o3、o4-mini 等模型的推理能力,紧密连接本地开发环境,未来还会支持 GPT 4.1 等其他模型。

值得一提的是,它甚至支持通过截图或手绘草图进行多模态编程,直接刷新了代码交互与内容理解的边界。

Agent 要被吃进大模型了

雷峰网(公众号:雷峰网)观察到,为了测试这个功能,在发布会的实况中,开发人员还现场用 Codex CLI 展示了一波实施摄影的 ASCII 画面,让不少实况间网友大呼:“Intresting!”参考链接:

https://x.com/sama/status/1912558495997784441

https://news.ycombinator.com/item?id=43707719#43711155

https://github.com/openai/codex

https://x.com/jhyuxm/status/1912562461624131982


雷峰网原创文章,未经授权禁止转载。详情见转载须知。

Agent 要被吃进大模型了

风谈集

更多 >
  • 伊朗军队举行导弹演习
    更新:2025-09-09 17:05
  • 步惊云:一场春梦总是做不完
    更新:2025-09-09 16:24
  • 斐济群岛地区发生6.6级地震,震源深度300千米
    更新:2025-09-09 15:50
  • 传统职业遇见创新思维 你的未来不止一条赛道
    更新:2025-09-09 14:58

热门文章

  • 腾讯Robotics X具身智能开放平台Tairos发布,融合左脑、右脑、小脑
    腾讯Robotics X具身智能开放平台Tairos发布,融合左脑、右脑、小脑

    腾讯Robotics X具身智能开放平台Tairos发布,融合左脑、右脑、小脑

    7月27日,2025世界人工智能大会腾讯论坛期间,腾讯 Robotics X 实验室与福田实验室联合发布具身智能平台Tairos钛螺丝)。雷峰网(公众号:雷峰网)AI科技评论获悉,其由模型算法和云服务 ...

  • 美国一架客机起飞后紧急下降 致两名空乘人员受伤
    美国一架客机起飞后紧急下降 致两名空乘人员受伤

    美国一架客机起飞后紧急下降 致两名空乘人员受伤

    △资料图当地时间7月25日,美国西南航空公司一架从加州伯班克起飞的航班在起飞后不久因两次机上警报紧急下降,导致两名空乘人员受伤。西南航空表示,没有乘客受伤,但两名空乘人员正在接受治疗。该航空公司未透露 ...

  • 演技短板暴露!杨超越资源暴跌,'锦鲤'体质还能撑多久?
    演技短板暴露!杨超越资源暴跌,'锦鲤'体质还能撑多久?

    演技短板暴露!杨超越资源暴跌,'锦鲤'体质还能撑多久?

    在娱乐圈这个更新换代飞快的行业里,有些明星的热度来得快去得也快。近期有网友整理出一批长期未进组的演员名单,其中不乏曾经炙手可热的流量代表。例如王一博、林一、胡一天和刘亦菲等,而杨超越也悄然位列其中。回 ...

  • 柬埔寨称泰国在边境冲突中使用集束弹药
    柬埔寨称泰国在边境冲突中使用集束弹药

    柬埔寨称泰国在边境冲突中使用集束弹药

    新华社金边7月25日电记者吴长伟)柬埔寨排雷行动和援助受害者管理局25日发表声明说,泰国军队在柬埔寨境内的边境地区使用了国际禁用的集束弹药。声明说,泰军在柬埔寨柏威夏省使用的集束弹药对平民、排雷人员和 ...

  • 出身“企鹅”的“T4大神”,带领小鹅通闯关港交所
    出身“企鹅”的“T4大神”,带领小鹅通闯关港交所

    出身“企鹅”的“T4大神”,带领小鹅通闯关港交所

    每经记者 蔡 鼎 每经编辑 魏文艺8月22日,港交所官网显示,SaaS软件运营服务)解决方案供应商深圳小鹅网络技术有限公司Xiaoe Inc。,以下简称小鹅通,证券简称“XIAOE”)当日向港交所首次 ...

  • 港片狠人上线《扫毒风暴》!毒枭K哥,居然是铜锣湾浩南和加钱哥
    港片狠人上线《扫毒风暴》!毒枭K哥,居然是铜锣湾浩南和加钱哥

    港片狠人上线《扫毒风暴》!毒枭K哥,居然是铜锣湾浩南和加钱哥

    头号电影院懂小姐topcinema原创,严禁转载)《扫毒风暴》里的反派不少,但戏份不多,却能演出独特个人风格的,要数下面这位——穿着精致西装,满嘴英文的:毒枭K哥。就连剧中的反派、宛北大毒枭云司令女婿 ...

  • 伊朗与欧洲三国在伊斯坦布尔开启新一轮核谈判
    伊朗与欧洲三国在伊斯坦布尔开启新一轮核谈判

    伊朗与欧洲三国在伊斯坦布尔开启新一轮核谈判

    当地时间7月25日,伊朗与伊核协议中的英国、法国、德国三国即E3)在伊朗驻伊斯坦布尔总领事馆开启新一轮核问题谈判。这是自6月以伊停火以来,伊朗与欧洲三国的首次会晤。根据此前多方消息,谈判预计于当地时间 ...

  • 内蒙古阿拉善盟阿拉善左旗发生4.7级地震
    内蒙古阿拉善盟阿拉善左旗发生4.7级地震

    内蒙古阿拉善盟阿拉善左旗发生4.7级地震

    中国地震台网正式测定:07月26日01时02分在内蒙古阿拉善盟阿拉善左旗北纬38.24度,东经104.02度)发生4.7级地震,震源深度10千米。总台央视记者 张腾飞) ...

风台闻

更多 >
  • SpaceX“星舰”成功溅落,第十次试飞圆满结束
    SpaceX“星舰”成功溅落,第十次试飞圆满结束

    美国太空探索技术公司SpaceX)新一代重型运载火箭“星舰”美国中部时间8月26日18时30分北京时间26日7时30分)从得克萨斯州发射升空,实施第十次试飞。此次任务重点目标包括让飞船部署模拟卫星、在 ...

  • 你属于我,酋长近端锋凯尔西首次晒出与霉霉恋爱后的甜蜜合照
    你属于我,酋长近端锋凯尔西首次晒出与霉霉恋爱后的甜蜜合照

    堪萨斯城酋长队近端锋凯尔西首次晒出与霉霉恋爱后的甜蜜合照,正式在媒体上“官宣”恋情。凯尔西在动态中写道:“这个休赛期经历了不少冒险,一切都很真实。”2023年7月,凯尔西参加了霉霉在堪萨斯城的巡演,并 ...

  • 甘肃酒泉市肃北县发生3.1级地震
    甘肃酒泉市肃北县发生3.1级地震

    中国地震台网正式测定:7月25日23时23分,在甘肃酒泉市肃北县北纬41.43度,东经97.55度)发生3.1级地震,震源深度38公里。总台央视记者 张腾飞) ...

  • 6名学生溺亡,东北大学官网已变黑白
    6名学生溺亡,东北大学官网已变黑白

    7月25日,东北大学官网显示,网站颜色已变黑白。据新华社报道,7月23日10时20分许,东北大学6名学生在中国黄金集团内蒙古矿业有限公司乌努格吐山铜钼矿选矿厂参观学习浮选工艺过程中,因格栅板脱落坠入浮 ...

  • 千百惠曾谈衰老:不要一直想到我年轻的时候,要坦然面对老去
    千百惠曾谈衰老:不要一直想到我年轻的时候,要坦然面对老去

    著名歌手千百惠于8月19日凌晨因病离世,享年62岁。南都N视频记者注意到,千百惠曾表示,“人怎么不会老呢?不要一直想到我年轻的时候,听众长大了,我也老了。我们要坦然面对慢慢老去的事实。”她还说,“我的 ...

  • 抖音拿下周杰伦,快手还剩什么“杀手锏”?
    抖音拿下周杰伦,快手还剩什么“杀手锏”?

    作者/新摘商业评论 拉面虾7月9日周杰伦入驻抖音,生动地证明了什么叫"你大爷永远是你大爷"。入驻第一天仅仅是注册账号,粉丝数就暴涨七百万。与周杰伦关联的港股公司巨星传奇,更是一日就实现股价翻倍,市值增 ...

  • 泰媒称泰军占领两处寺庙 柬埔寨国防部否认
    泰媒称泰军占领两处寺庙 柬埔寨国防部否认

    △资料图当地时间7月25日,柬埔寨国防部发言人玛丽淑洁达表示,《泰国民族报》关于泰国军方占领柏威夏寺和高锡克寺的新闻报道是虚假消息,直到现在,这两处寺庙仍然在柬埔寨军队控制之下。泰国方面对此暂无回应。 ...

  • 俄罗斯一客机因客舱失压返航
    俄罗斯一客机因客舱失压返航

    据塔斯社当地时间25日报道,一架从新西伯利亚飞往索契的俄罗斯客机发生客舱失压,目前正返回起飞机场。 ...

  • 社保重大改革,要把就业放第一
    社保重大改革,要把就业放第一

    来源:中国新闻周刊最高人民法院审判委员会第1942次会议通过的《关于审理劳动争议案件适用法律问题的解释二)》下称“司法解释”),将于9月1日正式实施。其中,第十九条的内容涉及社会保险参保的条件和要求, ...

  • 宗馥莉的事越来越匪夷所思,父亲并没离婚,原来,王诗龄才赢麻了
    宗馥莉的事越来越匪夷所思,父亲并没离婚,原来,王诗龄才赢麻了

    1宗家的事,又曝了一个大瓜。财新网发文,称宗庆后与施幼珍,并未离婚。这也就是说,宗庆后出轨了几十年。杜建英是100%小三。宗继昌、宗婕莉、宗继盛是100%私生子。这也就意味着,他给杜建英和三个私生子的 ...

  • 轻松兼职?小心“被当枪”!
    轻松兼职?小心“被当枪”!

    警惕!未成年人社会经验不足,可能在毫无察觉中,被诱导成为诈骗分子的“传声筒”。你以为的“躺赚”,也许是在给诈骗 “当枪”! ...

  • 780元票价被炒至1万元,易烊千玺演唱会门票遭高价倒卖
    780元票价被炒至1万元,易烊千玺演唱会门票遭高价倒卖

    虽然购票采取了强实名制,但歌手易烊千玺2025礐嶨演唱会门票仍然被炒至万元。7月25日,界面新闻在闲鱼发现,原本1800元的门票被炒至3000元,1480元的门票被炒至9999元,780元的门票更是被 ...

风风点泰国被停职总理佩通坦就其涉嫌违宪案出庭作证
风事爆港片狠人上线《扫毒风暴》!毒枭K哥,居然是铜锣湾浩南和加钱哥
风汇台女演员在机场被陌生人敲头!工作室发声
料点特朗普:相信鲍威尔已经准备好要降低利率了
娱乐星星眼要跟美瞳小花再婚了
风风新国常会:部署逐步推行免费学前教育有关举措

校园八卦

更多 >