机器之心报道
机器之心编辑部
AI 圈的头条被 DeepSeek 承包了十几天,昨天,OpenAI 终于坐不住了,推出了全新推理模型系列 o3-mini。不仅首次向免费用户开放了推理模型,而且相比之前的 o1 系列,成本更是降低了 15 倍之多。
OpenAI 也称这是其推理模型系列中最新、最具成本效益的模型:

刚刚上线,已经有网友迫不及待的拿它和席卷整个大模型圈的国产大模型 DeepSeek R1 进行对比了。
前段时间,AI 社区开始沉迷用 DeepSeek R1 和其他(推理)模型比拼这个任务:「编写一个 Python 脚本,让一个球在某个形状内弹跳。让该形状缓慢旋转,并确保球停留在形状内。」
这种模拟弹跳球的测试是一个经典的编程挑战。它相当于一个碰撞检测算法,需要模型去识别两个物体(例如一个球和一个形状的侧面)何时发生碰撞。编写不当的算法会出现明显的物理错误。
在 DeepSeek R1 席卷国内外热搜,微软、英伟达、亚马逊等美国云计算平台争先恐后引进 R1 的同时,R1 也在这个任务中完成了对 OpenAI o1 pro 的碾压。
再看 Claude 3.5 Sonnet 和谷歌的 Gemini 1.5 Pro 的生成结果,DeepSeek 旗下的开源模型高出的确实不只是一个 level。

然而,在 o3-mini 上线后,剧情似乎一夜反转了,比如这个帖子宣称 OpenAI o3-mini 碾压了 DeepSeek R1。目前已引发近 400 万网友围观。

该开发者用的 prompt 是:"write a Python program that shows a ball bouncing inside a spinning hexagon. The ball should be affected by gravity and friction, and it must bounce off the rotating walls realistically"
也就是分别让 o3-mini 和 DeepSeek R1 写一个球在旋转的六边形内弹跳的 python 程序,小球跳动的过程中要遵循重力和摩擦力的影响。最后的展示效果如下:

从效果来看,o3-mini 把碰撞、弹跳效果展示的更好。从对重力和摩擦力的理解来看,DeepSeek R1 版本的小球似乎有点压不住牛顿的棺材板了,完全不受重力控制。
这并非个案,@hyperbolic_labs 联合创始人 Yuchen Jin 在此之前也发现了这个问题,他分别向 DeepSeek R1 和 o3-mini 输入了提示词:write a python script of a ball bouncing inside a tesseract(编写一个 Python 脚本,模拟一个球在四维超立方体内部弹跳)。
四维超立方体的每个顶点与四条棱相邻,每条棱则连接两个立方体。四维空间内的几何图形超出了人类的直观感知范围,所以听着这些描述,我们可能很难想象出一个四维超立方体长什么样子。
而 o3mini 不仅展现出了稳定的几何结构,小球在四维空间内弹跳的运动轨迹也较为灵活,有撞到立方体侧面的打击感。

再来看 DeepSeek R1 这边,它对四维超立方体的形状理解似乎还不够深入透彻。同时,小球在其中的运动轨迹也显得有些诡异,有一种「飘忽不定」的感觉。

据 Yuchen Jin 称,他试了很多次,所有用 DeepSeek R1 尝试都比一次性的 o3-mini 要差,比如下面这次就剩下球了。

机器之心也亲测了一把,同样是 Pass@1 测试,DeepSeek R1 这次是既有球又有几何外框了,甚至小球还会变换颜色色,遗憾的是,它把四维超立方体简化成了三维空间坐标轴。

o3-mini 的表现则有些「买家秀」的意味,明明和 Yuchen Jin 输入的是完全一样的提示词,为什么 o3-mini 就不会了?得不到如上所示的「卖家秀」了呢?

看来,在生成小球在几何外框内跳动的程序这方面,DeepSeek R1 并不是完全是 o3-mini 的手下败将。
AIGC 从业者 @myapdx 用了一个更加复杂的同类提示词来测试 o3-mini 和 DeepSeek R1:编写一个 p5.js 脚本,模拟 100 个彩色小球在一个球体内部弹跳。每个小球都应留下一条逐渐消失的轨迹,显示其最近的路径。容器球体应缓慢旋转。请确保实现适当的碰撞检测,使小球保持在球体内部。
o3-mini 的效果是这样的:

提示词里的这么多项要求:在球体内部弹跳、留下逐渐消失的轨迹、容器缓慢旋转......o3-mini 都完美满足。
而 DeepSeek R1 的效果,好像也没差到哪里去:

至于为什么会出现这样的差异,Yuchen Jin 和 @myapdx 都在帖子中提到,这个任务对模型如何理解真实世界的物理规律有所反应。模型需要综合自己对语言、几何、物理和编程的理解,方能得出最后的模拟结果。从前两轮的结果看来,o3-mini 有可能是物理学得最好的大模型。
与此同时,OpenAI 也在昨天的发布博客中强调过,在博士极科学问题方面 o3-mini-low 的表现优于 o1-mini。o3-mini-high 的表现与 o1 相当,在博士级生物学、化学和物理问题上都有显著进步。
对人类来说,理解小球跳动时的重力和摩擦力并不算困难,但在大语言模型领域,这种对物体物理状态的「世界模型」理解能力,直到最近才真正突破。
还有网友猜测,DeepSeek R1 的程序有时只有一个球,会不会是它想得太多了?
不知是否有读者亲自体验过?欢迎讨论。

https://x.com/flavioAd/status/1885449107436679394
https://x.com/iamRezaSayar/status/1885760491466997791
https://x.com/Yuchenj_UW/status/1885416559029740007
https://x.com/Yuchenj_UW/status/1885472365309833382


APP专享直播
热门推荐
河南女子每天自驾110公里跨市上班 本人回应:不是老板,公司氛围好才坚持 收起河南女子每天自驾110公里跨市上班 本人回应:不是老板,公司氛围好才坚持
- 2025年03月10日
- 07:44
- APP专享
- 扒圈小记
12,704
为什么现在的商场爱叫“xx里”?
- 2025年03月10日
- 13:55
- APP专享
- 扒圈小记
7,518
突发!马斯克:遭到大规模攻击!
- 2025年03月10日
- 23:09
- APP专享
- 北京时间
6,011

24小时滚动播报最新的财经资讯和视频,更多粉丝福利扫描二维码关注(sinafinance)
投资研报 扫码订阅
股市直播
-
宋谈股经今天 08:16:51
【VIP教室】组合个股,今天修复上涨,蓄势待发,速戳抢购查阅,了解选股逻辑〉〉【更多独家重磅股市观点请点击】【更多独家重磅股市观点请点击】 -
波段擒龙今天 08:08:24
记者获悉,为深入贯彻落实国家关于发展人工智能的战略部署,推动人工智能与云计算等前沿技术的深度融合,3月13日,由杭州市经信局、杭州市数据资源局指导,浙江算力科技主办的“云智聚能,共筑AI产业新未来——人工智能与可控云计算产业生态大会”将在杭州举行。根据议程,大会将正式发布杭州市算力资源调度服务平台,举行算力生态共同体签约仪式,举办浙江算力与海光信息(sh688041)战略合作签约仪式等。同时,浙江算力、阿里云、华为、超聚变、海光信息(sh688041)、天数智芯、无问芯穹等将进行主题演讲。 (证券时报) -
波段擒龙今天 08:08:01
热门中概股美股盘前齐升,小鹏汽车涨逾9%,蔚来涨逾7%,哔哩哔哩涨逾6%,理想汽车涨逾5%,阿里巴巴涨超4%。 -
宋谈股经今天 07:53:14
今日共54股涨停,连板股总数14只,12股封板未遂,封板率为82%(不含ST股、退市股)。焦点股方面,高位的华丰股份(sh605100)、大位科技(sh600589)均实现连板晋级,信隆健康(sz002105)缩量涨停晋级6连板,正和生态(sh605069)、云内动力(sz000903)等人气股纷纷走出反包行情。 -
趋势领涨今天 07:49:20
有消息称,DeepSeek下一代AI模型DeepSeek-R2或提前于下周一(3月17日)正式发布。截至目前,DeepSeek官方尚未正式公布R2的具体日期及技术细节等。早前市场预期DeepSeek-R2模型于5月发布。就上述信息求证官方,截至发稿官方暂无回应。 -
宋谈股经今天 07:41:30
3月11日收评:沪指低开反弹涨0.41%,两市成交不足1.5万亿1、市场全天低开反弹,三大指数尾盘集体翻红。国资云概念股走强,湖北广电(sz000665)、数据港(sh603881)、美利云(sz000815)涨停。军工板块集体拉升,炼石航空(sz000697)、内蒙一机(sh600967)、火炬电子(sh603678)等涨停。猪肉股午后走高,天域生物(sh603717)、神农集团(sh605296)涨停。下跌方面,机器人(sz300024)概念股分化,夏厦精密(sz001306)等跌超5%。个股涨多跌少,沪深京三市约2800股飘红,今日成交1.52万亿。截止收盘沪指涨0.41%,深成指涨0.33%,创业板指涨0.19%。2、板块概念方面,军工、次新股、国资云、猪肉等板块涨幅居前,光刻机、AI医疗、软件开发、CRO等板块跌幅居前。3、两市共2754只个股上涨,65只个股涨停,2149只个股下跌,5只个股跌停,12只股票炸板,炸板率19%。 -
趋势起航今天 07:10:27
财富密码已解锁!昨日推荐股票连板飙升,涨幅惊人;今日再度出击,力荐的两只股票同样一路狂飙,强势涨停!这可不是运气,而是专业团队深度研究与精准预判的成果。此刻,趋势 VIP 重磅福利震撼登场!首开即享半价优惠,半年费用直降至 415 元 / 月。如此超值的价格,在投资服务领域堪称史无前例,这是你千载难逢的财富机遇。然而,幸运只青睐少数人。本次特惠活动仅开放前 50 个名额,先到先得,一旦满员,优惠瞬间消失。财富浪潮转瞬即逝,你还在犹豫什么?立即抢占趋势 VIP 席位,搭乘涨停快车,订阅地址:【更多独家重磅股市观点请点击】【更多独家重磅股市观点请点击】 -
徐善武今天 07:06:56
有点意思 开盘最低点 收盘最高点 -
巨丰投资张翠霞今天 07:05:09
4小时运行结束,总结全天市场运行,1)相较美股大跌,A股低开高走,报收光头阳线,阳包阴反包上涨中继K线,MACD指标闭合,短期方向抉择,方向明确后迎来单边行情;2)量能,沪深两市今日成交额15198亿元,较上个交易日15440亿元减少242亿元;3)行业板块方面,以加权涨幅来看56家行业28家红盘,商贸代理、日用化工、酿酒等板块涨幅居前;工程机械、汽车类、互联网等板块跌幅居前;4)市场延续结构型行情,题材热点快速轮动。详细解盘,可关注《翠霞首席课》的“热点直击”和“操盘指南”~~~ -
趋势起航今天 07:05:06
市场全天低开高走,三大指数均收光头阳线,沪深两市全天成交额1.48万亿,较上个交易日缩量238亿。盘面上,市场热点较为杂乱,个股涨多跌少,全市场超2800只个股上涨。从板块来看,国资云概念股集体大涨,湖北广电(sz000665)等涨停。军工股震荡走强,内蒙一机(sh600967)等涨停。猪肉股展开反弹,神农集团(sh605296)涨停。板块方面,军工、小金属、猪肉、国资云等板块涨幅居前,光刻机、AI医疗、软件开发、CRO等板块跌幅居前。截至收盘,沪指涨0.41%,深成指涨0.33%,创业板指涨0.19%。