DeepSeek和智谱接连更新模型,但都没能炸场

DeepSeek和智谱接连更新模型,但都没能炸场
2026年08月15日 10:38 界面新闻

没有一家模型厂商最近能够放松警惕。前后大概不到48小时,DeepSeek和智谱相继更新了自己的模型进展。

先是DeepSeek于8月12日晚将API文档更新为DeepSeek-V4-Pro正式版,又于13日对官宣内容进行了回撤和重新发布,但调整期间保留API服务;再是8月14日,智谱GLM-5.3正式发布。

抛开DeepSeek回撤事件本身可能存在的问题暂且不谈(当时大量评测称第三方测试结果与官方声明不符,甚至反馈不如同模型的Flash版本),官方公告显示,正式版DeepSeek V4 Pro是一款针对Agent(智能体)能力进行增强的模型,尤其在生产环境任务中表现出更为明显的性能提升。

在Agent相关评测集中,其总体成绩与Kimi K3、Opus 4.8和Fable 5在同一水平线上。

智谱GLM-5.3则继续强调编程能力。该模型与前代GLM-5.2使用完全相同的基座模型,主要通过后训练提升性能,利用强化学习(基于IndexShare、SAO以及新一代Slime框架)扩展了长程任务环境和训练时长。

从评测集表现来看,GLM-5.3的部分能力接近Fable 5和GPT-5.6 Sol,并在展示出来的多个榜单中成绩超过了Kimi K3,但在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上仍然不及K3。

安全是GLM-5.3强调的另一个特性,此前Anthropic的Mythos 5曾引起模型安全性能的话题热度。

据其介绍,在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞,GLM-5.3得分为84.5%,略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%;在更考验深度推理能力的ExploitBench中,GLM-5.3得分为54.4%,低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。

在用户层面,或是由于DeepSeek-V4-Pro正式版受到初期问题的影响,多名完成测试的受访者对界面新闻记者表示,在编程任务上,GLM-5.3的体验比DeepSeek-V4-Pro正式版更好。

不过,其中一名开发者明确表示,这两者可能都不会作为工作流主力,“国产模型里面,目前还是只有K3在第一梯队。”他说,这不仅体现在能力提升全面上,在性价比层面也有意义。

这个结论的一个重要背景是DeepSeek对其API定价策略进行了调整。

其API将首次采用峰谷定价模式,其中闲时段的使用价格将降至高峰时段的一半。但从DeepSeek V4 Pro高峰期价格来看,其缓存命中输入和缓存未命中输入单价分别同比增长1100%及200%,输出价格同比增长350%。

细致到K3与DeepSeek-V4-Pro正式版之间,涨价前,前者缓存命中输入价格为后者约一千倍,目前则是十倍左右,缓存未命中输入价格则从6倍有余减少到约2倍(高峰期),输出价格也从过去的16倍左右降低到现在的约4倍。

曾经一度悬殊的性价比表现,如今再将任务的对话轮次、完成质量、整体时长考虑其中,不同诉求的开发者再作抉择时答案可能会发生变化。

事实上,无论是DeepSeek-V4-Pro正式版还是GLM-5.3,都是在上一代基座模型基础上进行后训练迭代,Kimi K3实现性能突破则源于对基座模型再度扩大规模训练。这两种选择说明了什么问题?

一名AI领域投资人表示,从模型技术层面来说,这至少说明两点,预训练Scale Up仍然有用、现有规模后训练也有极大提升空间——在这一点上,更好的证据是1.5T的Grok 4.6,几乎达到了GPT-5.6、Opus 5的同等水平。

对国产模型厂商而言,这意味着代际层面的性能跨越,或许仍然绕不开基座模型的Scale Up,而与此同时,在它们实现这一点之前,Kimi K3的潜能显然也还没有充分挖掘。

新浪科技公众号
新浪科技公众号

“掌”握科技鲜闻 (微信搜索techsina或扫描左侧二维码关注)

创事记

科学探索

科学大家

苹果汇

众测

专题

官方微博

新浪科技 新浪数码 新浪手机 科学探索 苹果汇 新浪众测

公众号

新浪科技

新浪科技为你带来最新鲜的科技资讯

苹果汇

苹果汇为你带来最新鲜的苹果产品新闻

新浪众测

新酷产品第一时间免费试玩

新浪探索

提供最新的科学家新闻,精彩的震撼图片