
新智元报道
编辑:编辑部 HYZ
【新智元导读】眼看DeepSeek风头尽显,被逼急的OpenAI果然紧急发布了o3-mni。不光免费用户都能用,每百万输入和输出token价格更是疯狂跳水打骨折价!
o3-mini,真的来了。
刚刚,OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。

诚如奥特曼所言,免费用户直接打开「Reason」即可体验,Plus用户每天会有更多用量,具体来说:
- ChatGPT免费版:首次体验推理模型
- ChatGPT Plus和团队版:每天150次对话限制
- ChatGPT Pro:无限制访问
- ChatGPT Enterprise和ChatGPT Edu:将在一周内可用
- API:向3-5级开发者开放(初期暂不支持图像分析功能)
- 输入1.10美元/百万token、输出4.40美元/百万token
感谢DeepSeek,o3-mini的价格这次算是彻底给打下来了——比OpenAI o1-mini便宜63%,比满血版o1便宜93%。(但仍是GPT-4o mini的7倍左右)

订阅用户已经在第一时间「告别」了o1-mini,还没来得及说再见
OpenAI表示,o3-mini的发布是在追求高效能智能技术道路上的又一重要里程碑。
通过优化科学(Science)、技术(Technology)、工程(Engineering)和数学(Mathematics)领域的推理能力,同时保持较低的成本,让高质量AI技术变得更加平易近人。
值得一提的是,在ChatGPT中,o3-mini采用的是「中等推理强度」,在速度和准确性之间取得平衡。所有付费用户还可以在模型选择器中选择o3-mini-high——响应时间略长但智能水平更高的版本。

目前,由于太过火爆,ChatGPT的项目和自定义GPTs功能都已经被挤崩了。

集成搜索,两种版本可选
去年12月,。相较于上一代o1模型,o3在ARC-AGI等多项基准测试中刷新SOTA。
与o1-mini一样,o3-mini是最具性价比的推理模型,可谓是突破性能边界的「小巨人」。
在STEM领域,尤其是科学、数学和编程等方面,o3-mini性能表现卓越超越o1,并继承了上一代低成本和低延迟的优点。

对于开发者来说,o3-mini简直就是一份「大礼包」,它首次在小型推理模型中支持:包括函数调用、结构化输出和开发者消息、流式传输功能。
开发者可以根据需求选择低、中、高三种推理强度,让o3-mini在处理复杂问题时进行「深度思考」,灵活平衡速度和准确性。
遗憾地是,o3-mini暂不支持视觉功能。
如前所述,从今天起,o3-mini将通过Chat Completions API,Assistants API和Batch API向3-5级指定开发者开放。
同时,o3-mini还整合了搜索功能,能够提供带有相关网络来源链接最新响应。
一起来看看这款「小而美」的o3-mini有什么过人之处。
快速、强大、专为STEM领域推理优化
与其前身OpenAI o1类似,OpenAI o3-mini专门针对STEM推理进行了优化。
采用了中等推理强度的o3-mini,在数学、编程和科学领域的表现与o1不相上下,且响应速度更快。

报告地址:https://cdn.openai.com/o3-mini-system-card.pdf
专家测试评估显示,o3-mini相比o1-mini能够生成更准确、更清晰的答案,推理能力更强。
在测试中,o3-mini的响应结果获得了56%的偏好度,在处理复杂现实问题时的重大错误率更是降低了39%。
在中等推理强度设置下,o3-mini在最具挑战性的推理和智能评估项目(包括AIME和GPQA)中,均达到了与o1相当的水平。
数学竞赛(AIME 2024)
在低推理强度下,o3-mini达到了与o1-mini相当的水平;在中等推理强度下,其表现可与o1媲美;而在高推理强度下,o3-mini的表现更是超越了o1-mini和o1。

博士级科学问题(GPQA Diamond)

研究级数学(FrontierMath)
在高推理强度模式下,o3-mini在FrontierMath中的表现优于前代产品。当配合Python工具使用时,高推理强度的o3-mini能够一次性解决超过32%的测试题目,其中包括28%以上的T3级问题。

编程竞赛(Codeforces)
随着推理强度的提升,OpenAI o3-mini的Elo得分不断提高,各层级表现均优于o1-mini。在中等推理强度下,其表现已能与o1相媲美。

软件工程(SWE-bench Verified)
o3-mini在高推理强度模式下,使用开源Agentless框架能达到39%的成功率,使用内部工具框架则可达到61%的成功率。

LiveBench编码

人类偏好评估
外部专家评测结果显示,o3-mini较o1-mini表现出更强的推理能力,能够生成更准确、更清晰的答案,尤其是在STEM领域中。在对比测试中,o3-mini获得了56%的用户偏好度,且在处理复杂现实问题时的重大错误率降低了39%。

在技术报告中,o3-mini编程性能超越了GPT-4o和o1-preview,与o1不相上下。

模型的速度与性能
o3-mini在保持与o1相当智能水平的同时,实现了更快的运行速度和更高的计算效率。
除前文提到的STEM评估外,在中等推理强度下,o3-mini在其他数学能力和事实准确性测试中均取得了显著优势。
对比测试(A/B Testing)结果显示,o3-mini的平均响应时间为7.7秒,较o1-mini的10.16秒提升了24%。
o1-mini和o3-mini(medium)的延迟对比


安全评估
OpenAI在训练o3-mini确保其安全响应,采用的关键技术之一是审慎对齐(deliberative alignment)。
这项技术使模型能够在响应用户提示词前,对人工制定的安全规范进行全面推理。
与o1相似,o3-mini在高难度安全性测试和越狱评估中,明显优于GPT-4o。
在正式部署前,研究人员采用与o1相同的准备方法,结合外部红队测试和安全性评估,对o3-mini的安全风险进行了全面评估。
禁止内容评估

越狱评估

OpenAI急了
去年年底放出o3和o3-mini的预览时,CEO奥特曼就曾表示,o3-mini将会在1月份发布。
随后,奥特曼又在1月17日预告称,o3-mini会在几周内发布。

现在,o3-mini果然如约而至(卡在ddl最后一天),但外面的世界已经是天差地别。
面对正在快速崛起的DeepSeek-R1,o3-mini存在着一个关键问题——「不开源」。
这也就意味着,它无法离线使用、无法下载代码,也无法以相同的程度进行自定义。对于很多应用过来说,它的吸引力相对于R1明显大打折扣。
在上下文窗口方面,DeepSeek-R1约为128K/130K token,而o3-mini略胜一筹达到了200K token。其中,每个输出最多100K token,跟满血版o1相同。
在价格方面,相比于输入/输出token分别为0.14/0.55美元的DeepSeek-R1,o3-mini依然贵出了天际。
但作为一款美国模型,o3-mini在身份上无疑占尽了好处:应该会是欧美很多企业的首选。

奥特曼亲自率队
这一次,最强最新的o3-mini模型训练,奥特曼本尊下场亲自率队。研究项目主管分别是Carpus Chang和Kristen Ying。

接下来,如果说OpenAI还藏在什么杀手锏,那就是满血版的o3了。 根据12月时的说法,它将在「此后不久」发布。
参考资料:
https://openai.com/index/openai-o3-mini/
https://openai.com/index/o3-mini-system-card/



APP专享直播
热门推荐
“英雄团长”祁发宝,再获表彰 收起“英雄团长”祁发宝,再获表彰
- 2025年03月03日
- 01:08
- APP专享
- 扒圈小记
23,803
“菜刀哥”李坤朋因病去世,享年39岁
- 2025年03月03日
- 02:40
- APP专享
- 扒圈小记
18,440
年仅39岁!救人英雄“菜刀哥”李坤朋去世 家属讣告:因病抢救无效辞世,殡期定于3月5日
- 2025年03月03日
- 03:26
- APP专享
- 北京时间
3,994

24小时滚动播报最新的财经资讯和视频,更多粉丝福利扫描二维码关注(sinafinance)
投资研报 扫码订阅
股市直播
-
趋势领涨今天 08:09:43
【今日投资舆情热点】1)固态电池:机构称,全固态电池的装车节奏预期逐步收敛,即2027年小批量/示范性上车,2030年大规模量产。2)AI应用:《深圳市加快推进人工智能终端产业发展行动计划(2025—2026年)》印发,力争2026年人工智能终端产业规模达1万亿元。3)核聚变:中国核电(sh601985)、浙能电力(sh600023)相继公告,拟以增资方式参股中国聚变能源有限公司。4)云计算:DeepSeek称,理论成本利润率可达545%;大集群规模效应+高并发利用率带来降本,AI上云或将是控本首选。5)深圳机器人(sz300024):《深圳市具身智能机器人(sz300024)技术创新与产业发展行动计划(2025-2027年)》印发,新增培育估值过百亿企业10家以上、营收超十亿企业20家以上。 -
趋势领涨今天 08:07:21
【今日投资舆情热点】1)固态电池:机构称,全固态电池的装车节奏预期逐步收敛,即2027年小批量/示范性上车,2030年大规模量产。2)AI应用:《深圳市加快推进人工智能终端产业发展行动计划(2025—2026年)》印发,力争2026年人工智能终端产业规模达1万亿元。3)核聚变:中国核电(sh601985)、浙能电力(sh600023)相继公告,拟以增资方式参股中国聚变能源有限公司。4)云计算:DeepSeek称,理论成本利润率可达545%;大集群规模效应+高并发利用率带来降本,AI上云或将是控本首选。5)深圳机器人(sz300024):《深圳市具身智能机器人(sz300024)技术创新与产业发展行动计划(2025-2027年)》印发,新增培育估值过百亿企业10家以上、营收超十亿企业20家以上。 -
北京红竹今天 07:53:13
3、人形机器人(sz300024)和DS从资金上来看,还是在这2条线上,但不是说每天都要上涨。上周红竹提示了好几天的防守线已经持续,跌破就要调整,上周五确立了。大级别的结构还是向上,小级别这里等待个调整,调整结束后还是关注这个。这一波回落一批日线级别上涨的品种,当下都属于缩量回踩,行情是没什么可聊的,那就聊个小技巧吧。图片就比如说,这张图就是DS中的一个品种。很明显日线级别上涨段还没形成,当下回落一笔是构造三十分钟级别二买或者三买的预期。这时候我们应该怎么办呢?等待市场止跌信号,以及DS指数止跌信号,如果大盘和板块都出现止跌了,那么这样的个股大概率也止跌了,到时候再看这样的品种,是否出现突破反平台的走势。所以当下还真不是没事做,观察这样的品种,回落到位置,直接干。如果你找不到这种日线级别上涨段没走完的品种,可以看看【每周内参】 -
北京红竹今天 07:53:05
2、先行者回落的目标位预期图片以上是恒生科技指数的日线级别走势图一月份的时候红竹告诉过大家,恒生科技指数已经率先反转,级别是日线级别上涨段。目前只有一笔的上攻,如果当时你错过了第一波定投,那么现在的回落就不要错过了。什么时候开始定投?肯定不是昨天,也不会是今天,明天反弹也不是。最起码要等到最基本的调整结构出现,日线一笔,至少五个新低。空间上有2个位置,大家可以参考一下。0.382的位置5363点,0.50的位置5140点。在这两个位置到时候在观察三十分钟级别回落段的内部结构是否有背驰,有了就逐步定投。 -
北京红竹今天 07:52:59
1、结构还不满足探底反弹又回落,3300点是个强力支撑,明天大概率反抽。不过对于结构而言,咱们已经分类清楚了,剩下就是应对了。1、出现反包新高,那么宣布大风险来临。2、出现至少五天新低的回落,但不破3140点,迎接第二波反弹。3、跌破3140点,嘿嘿,迎接新一轮上涨,至少一个月的。做分类是我们做的事情,怎么走是市场的事情。市场给什么,咱做什么,简单明了。 -
宋谈股经今天 07:27:58
今日共64股涨停,连板股总数8只,39股封板未遂,封板率为62%(不含ST股、退市股)。焦点股方面,高位股持续退潮,市场高度板华丰股份(sh605100)尾盘跳水触及跌停上演“天地板”,杭钢股份(sh600126)、中大力德(sz002896)2连跌停,连板高度降至4连板的恒为科技(sh603496)。 -
趋势起航今天 07:15:21
市场全天冲高回落,三大指数涨跌不一。沪深两市全天成交额1.62万亿,较上个交易日缩量2423亿。盘面上,市场热点集中在新能源方向,个股涨多跌少,全市场超3200只个股上涨。从板块来看,固态电池以及新能源方向集体大涨,领湃科技(sz300530)等多股涨停。可控核聚变概念股盘中走强,中国核建(sh601611)涨停。医美概念股表现活跃,拉芳家化(sh603630)涨停。下跌方面,算力概念股持续调整,杭钢股份(sh600126)等跌停。板块方面,固态电池、民爆、可控核聚变、美容护理等板块涨幅居前,液冷服务器、白酒、存储芯片、算力等板块跌幅居前。截至收盘,沪指跌0.12%,深成指涨0.36%,创业板指涨1.2%。 -
巨丰投资张翠霞今天 07:12:34
4小时运行结束,总结全天市场运行,1)针对上周五长阴,今日早盘强修复,但下午冲高回落,反弹过程大幅缩量,未能复制去年3月初强修复走势,预期短期震荡走势,两会期间题材轮动;2)量能,沪深两市今日成交额16643亿元,较上个交易日18263亿元减少1620亿元;3)行业板块方面,以加权涨幅来看56家行业24家红盘,有色、矿物制品、日用化工等板块涨幅居前;公共交通、半导体、通信设备等板块跌幅居前;4)市场延续结构型行情,题材热点快速轮动。详细解盘,可关注《翠霞首席课》的“热点直击”和“操盘指南”~~~ -
趋势起航今天 07:09:19
市场全天冲高回落,三大指数涨跌互现。固态电池概念股全天强势,领湃科技(sz300530)、德尔股份(sz300473)、上海洗霸(sh603200)、红豆股份(sh600400)等多股涨停。可控核聚变概念拉升,永鼎股份(sh600105)、联创光电(sh600363)、中国核建(sh601611)、合锻智能(sh603011)等封板。下跌方面,算力概念股持续调整,杭钢股份(sh600126)等跌停;机器人(sz300024)概念股分化,中大力德(sz002896)等跌停。个股涨多跌少,沪深京三市超3300股飘红,今日成交1.66万亿。截止收盘沪指跌0.12%,深成指涨0.36%,创业板指涨1.2%。板块概念方面,固态电池、可控核聚变、民爆、钛白粉等板块涨幅居前,机器人(sz300024)、算力、食品饮料、存储芯片等板块跌幅居前。两市共2990只个股上涨,66只个股涨停,1935只个股下跌,33只个股跌停,38只股票炸板,炸板率41%。 -
宋谈股经今天 07:07:23
3月3日收评:创业板指冲高回落涨1.2%,固态电池概念股全天强势1、市场全天冲高回落,三大指数涨跌互现。固态电池概念股全天强势,领湃科技(sz300530)、德尔股份(sz300473)、上海洗霸(sh603200)、红豆股份(sh600400)等多股涨停。可控核聚变概念拉升,永鼎股份(sh600105)、联创光电(sh600363)、中国核建(sh601611)、合锻智能(sh603011)等封板。下跌方面,算力概念股持续调整,杭钢股份(sh600126)等跌停;机器人(sz300024)概念股分化,中大力德(sz002896)等跌停。个股涨多跌少,沪深京三市超3300股飘红,今日成交1.66万亿。截止收盘沪指跌0.12%,深成指涨0.36%,创业板指涨1.2%。2、板块概念方面,固态电池、可控核聚变、民爆、钛白粉等板块涨幅居前,机器人(sz300024)、算力、食品饮料、存储芯片等板块跌幅居前。3、两市共2990只个股上涨,66只个股涨停,1935只个股下跌,33只个股跌停,38只股票炸板,炸板率41%。