Kimi学会了自己干活,中国大模型坐到全球AI牌局主桌

2026年07月29日 15:27
本文共计5253个字,预计阅读时长18分钟。
来源/证券时报网 责编/ShuxiangMama 书香妈妈

两周前,月之暗面(Kimi)向全球AI大模型玩家扔出了一颗重磅炸弹——K3大模型。

瑞银分析师将其称为第二个DeepSeek时刻。不同于DeepSeek 1.0时刻一切从大模型性价比出发,K3带来的则是另一条叙事——当AI Agent嵌入工作流后,能给C端用户带来哪些效率的提升。

用户惊奇地发现,Kimi K3大模型不再是一问一答的聊天工具,而是开始像一名人类分析师那样规划任务检索信息调用工具并行协作交付成果也就是说Kimi学会了自己干活

当DeepSeek证明了中国模型能够快速运行之后,Kimi出色的Agent能力正在将中国大模型整体推入了一个新的竞争维度。这次比拼的不再是参数规模或数学题得分,而是谁的模型能够嵌入真实工作流,在用户离开后仍能持续交付成果。

这个改变也向世界传递了一个信号,在中国大模型的领域中不再只是全球AI竞赛的跟随者,而是在用自己干活的能力,参与到全球用户的争夺战中,并且在全球AI牌局里坐上了主桌。

过去两年,中国大模型的叙事主线并不复杂,主要在于运用更低的成本,训练出逼近甚至超越GPT-4性能的模型。

2025年初,DeepSeek通过极低的训练成本以及开源策略震动了全球,在业界被誉为国运级别的突破。一时间,国内AI赛道集体投入到了一场烧钱换参数、堆卡换性能的消耗战当中。

然而,一个无法回避的事实是,纯粹的模型性能比拼正在陷入边际效益递减的困境。实际上,用户不关心各家大模型的分数与排名,他们只关心程序能不能跑通、结果是否可靠。

Agent capabilities underwent a transition that precisely broke this deadlock. In July 2025, Moonshot AI released and open-sourced Kimi K2, first proposing that large models ought to be built for workflows. Kimi K2 therefore underwent optimization in code generation, tool calling, and multi-step task execution, being evaluated by the industry as a model built for AI Agents.

时隔一年,K3版本的落地则将这一趋势推向了更具说服力的生产场景。据月之暗面官方披露,K3在生成一个AI ASIC行业研究网站时,经历了120轮以上递归改进,完成2800次以上网页搜索与抓取,1100次以上终端数据调用,处理超过1.1万页内容,覆盖87份季度报告和99份原始PDF。

这些任务已不再是传统意义上的一次问答,而是由检索执行校验绘图和修改组成的长链路流程。华泰证券在研报中指出Agent渗透带来的核心增量并非用户请求数量本身而是每个任务内部Token消耗工具调用次数和并行执行宽度的共同增长这意味着真实工作流的渗透正在实质性提升。

支撑这种长程执行能力的,是一整套Agent基础设施的重新设计。据月之暗面技术报告披露,在K3训练和评估期间系统共创建了超过5100万个沙箱使长任务可以在等待模型推理时暂停以释放计算资源并且在模型生成下一步动作后快速恢复这相当于把一次原本几分钟的回答拉长成一条可持续数小时的执行链。

要知道,传统强化学习训练过程会被少数特别慢的任务拖住整批GPU的运行,而K3则通过partial rollout机制,让已完成的部分轨迹先进入模型更新,未完成的轨迹暂停后再恢复执行,从而容忍异步和延迟,真正让长程Agent任务进入了规模化训练阶段。

模型能力跃迁也反映在硬性工程评测当中。K3在大模型程序基准中取得了77.8的高分超过了GPT-5.6 Sol的77.6分在前沿软件工程中取得了81.2的高分分别比GPT-5.6 Sol和Claude Opus 4.8高出9.9和14.5。

这种长程Agent能力也体现在智能体专项评测中。据月之暗面披露,K3在BrowseComp等智能体任务评测中表现突出,在AutomationBench测试中取得最高成绩。

In engineering circles on social media, some have stated that K3 performs on par with Claude Fable 5 in agent workflows while featuring a markedly lower cost. This development has transformed agent capabilities from costly experiments reserved for a handful of large firms into practical engineering options that developers can afford and reuse.

大模型真正的护城河不在于单次对话的质量而在于能否嵌入用户的工作流成为无法被轻易替代的生产力环节一位长期跟踪AI赛道的分析师向记者表示Kimi的升级意味着中国大模型竞争从模型层向应用层的实质性迁移烧Token的阶段正在过去拼落地拼不可替代性的时代已经到来

Kimi为什么非要走C端这条难走的路

与智谱AI和百度文心等早期以B端企业服务以及API输出为主的大模型厂商不同Kimi自诞生起就选择了一条更难走的路直面C端用户。

这条路曾经备受质疑。B端市场合同金额高、客户忠诚度高,是大模型厂商最自然的商业化路径;而C端用户付费意愿低、获客成本高、产品迭代压力大,此前并无成功案例。然而,Kimi的C端策略在2025年下半年开始显现回报。

Kimi在与投资者的沟通中透露,公司海外收入已超过国内收入,2025年11月以来海外API收入增长4倍,全球付费用户在K2.5发布后实现4倍增长。在第三方平台OpenRouter上,K2.5的排名已升至第三位,仅次于Claude Sonnet 4.5和Gemini 3 Flash。这意味着,一个中国原生的大模型产品,正在全球C端市场获得真实付费用户的认可。

更值得关注的是其产品形态的创新。2025年9月月之暗面推出了全栈智能体助手OK Computer(Kimi Agent)随后又迭代出了Kimi K2.5的Agent集群能力。当面对分析100家竞争对手等复杂任务时模型可扮演中央调度器动态创建并协调数十个具备不同虚拟角色的Agent分身并行工作将原本需要数天的工作周期压缩至十几分钟。

K3的发布进一步验证了这一商业化逻辑。其API定价中,缓存命中输入、未命中输入和输出价格分别为0.30美元/百万Token、3.00美元/百万Token和15.00美元/百万Token,较K2系列明显提价,输出价格已与GPT-5.6 Terra相当。

RBS China Internet Analyst Xiong Wei stated that the pricing of K3 sits at the high end of domestic models, which accurately reflects that truly capable models command a price premium, and enterprises can likewise locate and pay users for such capabilities.

华泰证券亦在研报中认为,K3借助自动缓存和推理系统优化降低实际调用成本,使模型厂商能够在提升名义Token价格的同时不提高用户使用门槛,行业商业化竞争正由单纯低价转向模型能力、缓存效率与算力利用率的综合比拼。

If DeepSeek showed that Chinese models can be both cheap and high-performing, then Kimi proves that Chinese teams can also produce world-class C-end AI products. The analyst described this double breakthrough in product form and business model as filling the gap in consumer-grade applications for Chinese large models.

全球AI牌局里中国坐到了主桌

2026年1月,英伟达首席执行官黄仁勋在CES主题演讲中,运用Kimi K2 Thinking取代此前常见的DeepSeek-R1作为演示Rubin NVL72系统性能的案例,这一细节被市场解读为中国大模型在全球AI基础设施供应链中话语权的提升。

事实上,Kimi的路径选择正影响着整个行业对“中国大模型能做什么”的认知边界。2025年7月,Kimi K2开源后,在Hugging Face平台一周内下载量突破了10万次,并获得硅谷知名投资人在播客中的公开推荐。Kimi采用的MIT开源协议以及OpenAI兼容API和对vLLM等主流工具的支持,大幅降低了海外开发者的使用门槛。

更具生态意义的是,月之暗面将AgentENV、MoonEP以及FlashKDA等训练部署基础设施一并开放,这意味着开发者获得的不仅是一个可调用的模型,还是一套可以进一步研究、修改和复用的Agent工程资源。

开源模型的强劲势头也在倒逼全球领先玩家采取应对行动。瑞银分析师熊玮指出,近期OpenAI等海外厂商相继采取额度重置和Token降价等措施,这恰恰体现了中国模型在全球范围内开始得到更多市场以及行业对手的重视。

中国模型能够参与全球竞争,其背后是一套结构性的成本优势。借助瑞银的调研,目前中国头部模型的训练成本仅为海外领先模型的十分之一,API价格通常只有海外同类模型的10%至20%,与此同时,国内模型厂商的API业务仍能够保持20%至40%的毛利率。

RBS China Internet Analyst Xiong Wei analyzed that this structural cost advantage stems from innovations in model architecture, improvements in GPU usage efficiency, training strategies that balance performance with cost efficiency, and technical diffusion brought about by the open source ecosystem, and that this advantage is expected to remain sustainable for the long term.

从技术演进来看,Kimi的迭代轨迹也映射出中国大模型能力的跃迁:2024年聚焦长文本处理之后,2025年K1.5在多模态推理上逼近了OpenAI o1水平,2025年下半年K2系列则专攻Agentic任务与代码能力,2026年K2.5引入了原生多模态与Agent集群能力,再到2026年7月K3模型将参数规模推至2.8万亿个,并将上下文长度拓展至100万Token。

K3架构的升级也预示着推理基础设施竞争格局的变化。该模型采用Kimi Delta Attention与Attention Residuals架构,配合Stable LatentMoE,将专家数量扩展至896个,并明确提出由64张以上加速卡组成的超节点部署建议。

华泰证券认为,这意味着推理基础设施的竞争指标正在从单卡算力扩展至超节点内部互联、共享内存域、集合通信效率以及系统级稳定性,因此高速网络与整机系统的价值量有望随模型规模同步提升。

中国大模型已不再是单纯的追赶者角色。AI行业投资人向记者表示,DeepSeek在推理能力上的突破以及Kimi在Agent应用上的落地标志着中国AI力量正在从单点技术跟随走向生态能力并跑,这使得全球AI竞赛从美国创新中国复制的旧脚本进入了多极竞争的新阶段。

不过,竞争远未到终局。月之暗面创始人杨植麟曾在公开场合坦承,Agent集群的规模化训练在技术上很有挑战。

熊玮亦表示,目前两家大模型公司的上市时间都只有六七个月,整个行业仍处于市场不断学习和重新定价的阶段,投资者交易仍然呈现较强的动能驱动特征。因此,当行业出现新的模型发布、技术突破等积极催化时,相关公司股价往往会走强;而当市场对竞争格局、商业化前景产生新的担忧时,股价也可能随之回调。

如何在C端持续扩大付费用户规模、在B端创造更稳固的企业服务收入以及在全球化进程中应对地缘政治与合规风险仍旧是摆在Kimi面前尚未解决的难题。

But at least, Chinese large models are proving that, in this era where Agents redefine application paradigms, innovators from China are no longer mere observers at the table.

来源:Kimi学会了“自己干活”,中国大模型坐到了全球AI牌局主桌 | 证券时报网

声明:本文来自证券时报网,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯