奥特曼率队深夜血战DeepSeek，o3-mini急上线！价格骨折免费用，ChatGPT被挤爆_新浪财经

　　新智元报道

　　【新智元导读】眼看DeepSeek风头尽显，被逼急的OpenAI果然紧急发布了o3-mni。不光免费用户都能用，每百万输入和输出token价格更是疯狂跳水打骨折价！

　　o3-mini，真的来了。

　　刚刚，OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。

　　诚如奥特曼所言，免费用户直接打开‘Reason’即可体验，Plus用户每天会有更多用量，具体来说：

　　- ChatGPT免费版：首次体验推理模型

　　- ChatGPT Plus和团队版：每天150次对话限制

　　- ChatGPT Pro：无限制访问

　　- ChatGPT Enterprise和ChatGPT Edu：将在一周内可用

　　- API：向3-5级开发者开放（初期暂不支持图像分析功能）

　　- 输入1.10美元/百万token、输出4.40美元/百万token

　　感谢DeepSeek，o3-mini的价格这次算是彻底给打下来了——比OpenAI o1-mini便宜63%，比满血版o1便宜93%。（但仍是GPT-4o mini的7倍左右）

　　订阅用户已经在第一时间‘告别’了o1-mini，还没来得及说再见

　　OpenAI表示，o3-mini的发布是在追求高效能智能技术道路上的又一重要里程碑。

　　通过优化科学（Science）、技术（Technology）、工程（Engineering）和数学（Mathematics）领域的推理能力，同时保持较低的成本，让高质量AI技术变得更加平易近人。

　　值得一提的是，在ChatGPT中，o3-mini采用的是‘中等推理强度’，在速度和准确性之间取得平衡。所有付费用户还可以在模型选择器中选择o3-mini-high——响应时间略长但智能水平更高的版本。

　　目前，由于太过火爆，ChatGPT的项目和自定义GPTs功能都已经被挤崩了。

　　集成搜索，两种版本可选

　　去年12月，十二天直播最后一弹，o3系列首次亮相便惊艳了所有人。相较于上一代o1模型，o3在ARC-AGI等多项基准测试中刷新SOTA。

　　与o1-mini一样，o3-mini是最具性价比的推理模型，可谓是突破性能边界的‘小巨人’。

　　在STEM领域，尤其是科学、数学和编程等方面，o3-mini性能表现卓越超越o1，并继承了上一代低成本和低延迟的优点。

　　对于开发者来说，o3-mini简直就是一份‘大礼包’，它首次在小型推理模型中支持：包括函数调用、结构化输出和开发者消息、流式传输功能。

　　开发者可以根据需求选择低、中、高三种推理强度，让o3-mini在处理复杂问题时进行‘深度思考’，灵活平衡速度和准确性。

　　遗憾地是，o3-mini暂不支持视觉功能。

　　如前所述，从今天起，o3-mini将通过Chat Completions API，Assistants API和Batch API向3-5级指定开发者开放。

　　同时，o3-mini还整合了搜索功能，能够提供带有相关网络来源链接最新响应。

　　一起来看看这款‘小而美’的o3-mini有什么过人之处。

　　快速、强大、专为STEM领域推理优化

　　与其前身OpenAI o1类似，OpenAI o3-mini专门针对STEM推理进行了优化。

　　采用了中等推理强度的o3-mini，在数学、编程和科学领域的表现与o1不相上下，且响应速度更快。

　　报告地址：https：//cdn.openai.com/o3-mini-system-card.pdf

　　专家测试评估显示，o3-mini相比o1-mini能够生成更准确、更清晰的答案，推理能力更强。

　　在测试中，o3-mini的响应结果获得了56%的偏好度，在处理复杂现实问题时的重大错误率更是降低了39%。

　　在中等推理强度设置下，o3-mini在最具挑战性的推理和智能评估项目（包括AIME和GPQA）中，均达到了与o1相当的水平。

　　数学竞赛（AIME 2024）

　　在低推理强度下，o3-mini达到了与o1-mini相当的水平；在中等推理强度下，其表现可与o1媲美；而在高推理强度下，o3-mini的表现更是超越了o1-mini和o1。

　　博士级科学问题（GPQA Diamond）

　　研究级数学（FrontierMath）

　　在高推理强度模式下，o3-mini在FrontierMath中的表现优于前代产品。当配合Python工具使用时，高推理强度的o3-mini能够一次性解决超过32%的测试题目，其中包括28%以上的T3级问题。

　　编程竞赛（Codeforces）

　　随着推理强度的提升，OpenAI o3-mini的Elo得分不断提高，各层级表现均优于o1-mini。在中等推理强度下，其表现已能与o1相媲美。

　　软件工程（SWE-bench Verified）

　　o3-mini在高推理强度模式下，使用开源Agentless框架能达到39%的成功率，使用内部工具框架则可达到61%的成功率。

　　LiveBench编码

　　人类偏好评估

　　外部专家评测结果显示，o3-mini较o1-mini表现出更强的推理能力，能够生成更准确、更清晰的答案，尤其是在STEM领域中。在对比测试中，o3-mini获得了56%的用户偏好度，且在处理复杂现实问题时的重大错误率降低了39%。

　　在技术报告中，o3-mini编程性能超越了GPT-4o和o1-preview，与o1不相上下。

　　模型的速度与性能

　　o3-mini在保持与o1相当智能水平的同时，实现了更快的运行速度和更高的计算效率。

　　除前文提到的STEM评估外，在中等推理强度下，o3-mini在其他数学能力和事实准确性测试中均取得了显著优势。

　　对比测试（A/B Testing）结果显示，o3-mini的平均响应时间为7.7秒，较o1-mini的10.16秒提升了24%。

　　o1-mini和o3-mini（medium）的延迟对比

　　安全评估

　　OpenAI在训练o3-mini确保其安全响应，采用的关键技术之一是审慎对齐（deliberative alignment）。

　　这项技术使模型能够在响应用户提示词前，对人工制定的安全规范进行全面推理。

　　与o1相似，o3-mini在高难度安全性测试和越狱评估中，明显优于GPT-4o。

　　在正式部署前，研究人员采用与o1相同的准备方法，结合外部红队测试和安全性评估，对o3-mini的安全风险进行了全面评估。

　　禁止内容评估

　　越狱评估

　　OpenAI急了

　　去年年底放出o3和o3-mini的预览时，CEO奥特曼就曾表示，o3-mini将会在1月份发布。

　　随后，奥特曼又在1月17日预告称，o3-mini会在几周内发布。

　　现在，o3-mini果然如约而至（卡在ddl最后一天），但外面的世界已经是天差地别。

　　面对正在快速崛起的DeepSeek-R1，o3-mini存在着一个关键问题——‘不开源’。

　　这也就意味着，它无法离线使用、无法下载代码，也无法以相同的程度进行自定义。对于很多应用过来说，它的吸引力相对于R1明显大打折扣。

　　在上下文窗口方面，DeepSeek-R1约为128K/130K token，而o3-mini略胜一筹达到了200K token。其中，每个输出最多100K token，跟满血版o1相同。

　　在价格方面，相比于输入/输出token分别为0.14/0.55美元的DeepSeek-R1，o3-mini依然贵出了天际。

　　但作为一款美国模型，o3-mini在身份上无疑占尽了好处：应该会是欧美很多企业的首选。

　　奥特曼亲自率队

　　这一次，最强最新的o3-mini模型训练，奥特曼本尊下场亲自率队。研究项目主管分别是Carpus Chang和Kristen Ying。

　　接下来，如果说OpenAI还藏在什么杀手锏，那就是满血版的o3了。根据12月时的说法，它将在‘此后不久’发布。

海量资讯、精准解读，尽在新浪财经APP

责任编辑：韦子蓉

47条评论|413人参与网友评论

表情

分享到微博

发布

最热评论

紫罗兰语无伦次上海

要不是开源的，这玩意儿基本上就是在模仿DeepSeek

2月1日08:01举报查看对话赞93 回复

ali_003：回复@WindowsXP闪电：典中典

2月1日14:26举报赞回复

WindowsXP闪电：套着DeepSeek外壳的，估计是不好意思再收钱了

2月1日08:17举报赞3 回复

雀肚鸡嗎个不休湖南

紧急，哈哈，开发不都是得赶紧的吗？

2月1日08:03举报赞70 回复

百事可乐阿杰浙江湖州

大家看看源头，这模型是不是直接抄的DeepSeek

2月1日08:02举报赞31 回复

VIP课程推荐

年报季如何掘金

3月主线正式确立

题材周期运行图曝光

APP专享直播

开播时间 | 3-03 19:30

富国基金：两会前后，热点资产追什么？怎么追？

开播时间 | 3-03 20:00

创金合信基金肖伊莎：创金看市丨风格切换在即，如何踩准节奏？

开播时间 | 3-03 19:00

融通基金：升级版！量化如何赋能中证A500？

开播时间 | 3-03 16:30

银河基金：中证A500这只指数有何特色？

开播时间 | 3-03 16:00

易方达基金：大道至简问指数

开播时间 | 3-03 16:00

光大证券李泉：固态电池成行业热点，批量车企公布2月销量

开播时间 | 3-03 15:30

银华基金：指点迷津第161期百亿出海订单！中国创新药能否席卷全球？

开播时间 | 3-03 15:00

国投瑞银：追上科技热点 | 行情分化，科技怎么投？

开播时间 | 3-03 14:50

全国政协十四届三次会议发布会

开播时间 | 3-03 14:00

万家基金：低利率时代到来，投资如何求稳求进？

开播时间 | 3-03 19:30