本文素材来源于摩根士丹利 7 月 17 日发布的《中国基础大模型|亚太:月之暗面 K3 模型深度解读》研报,全部分析观点均来自机构原文,仅用于行业产业交流参考,不构成任何投资决策建议。
一、K3 落地,国产大模型实现阶段性追赶
在这份外资最新行业报告中,机构给出清晰判断:月之暗面新发布的 K3 不只是单一产品突破,更是国内大模型整体追上全球头部阵营的标志性信号。
这款 2.8 万亿参数开源模型综合实力全球第三,编程能力更是冲到全球首位,API 定价区间也第一次拉近和海外顶尖模型的差距。这份成果并非短期偶然突破,此前 GLM-5.2 已经打下扎实技术基础,后续国内还会持续推出参数规模更大、性能更强、商业化定价更高的大模型产品。
二、K3 核心产品硬实力拆解
7 月 17 日月之暗面正式对外发布 K3 大模型,整体参数规模达 2.8 万亿,是目前全球可开放完整权重的最大中文开源模型,全部权重文件会在 7 月 27 日前对外开源。
产品主打超长文本处理、专业知识研读、复杂逻辑推理场景,自研 Kimi Delta Attention、注意力残差两大原创算法,大幅优化算力利用效率。如果没有这套算法做支撑,2.8T 超大参数模型的推理成本会居高不下,很难落地商业化场景。
第三方评测榜单成绩十分亮眼:在 Artificial Analysis 综合智能榜单里,K3 排名全球第三,仅落后两款海外头部大模型;Arena.ai 编程专项榜单直接登顶全球第一。
定价层面,K3 API 收费标准处于国内大模型第一梯队,和海外头部产品的价差已经大幅收窄。
三、国内主流头部大模型横向对比
1. 参数规模对比
GLM-5.2 为 428B、阶跃星辰 V4-Pro 754B、DeepSeek 1600B、小米自研模型 1000B,而 K3 达到 2800B,体量接近第二名 DeepSeek 的 1.75 倍,放在全球开源模型里也属于第一梯队。
各家头部产品上下文窗口基本统一做到 100 万 token,超长文本能力已经不再是拉开差距的核心指标。
2. API 收费标准对比
输入侧(未缓存):K3 20 元 / 百万 token,阶跃星辰 8 元,GLM-5.2 3.15 元,DeepSeek、小米均为 3 元,通义千问 12 元;
输出侧价差更明显:K3 达到 100 元 / 百万 token,阶跃 28 元,GLM-5.2 12.6 元,DeepSeek、小米 6 元,通义 36 元;
缓存读取价格差距巨大,DeepSeek、小米低至几分钱,K3 与阶跃星辰持平,统一为 2 元 / 百万 token。
3. AA 综合智能指数
K3 得分 57 分,阶跃星辰 V4-Pro 51 分,通义千问 46 分,GLM-5.2、DeepSeek 同为 44 分,小米 42 分,头部产品之间分差 5-10 分,K3 领先优势突出。
此前国内大模型行业长期陷入低价内卷,各家不断压低调用价格。K3 敢于设置行业高价,核心依托自身过硬性能,也给行业树立新方向:优质模型可以依靠产品力实现合理定价,对行业良性发展有正向作用。
四、编程能力成为核心突破点
本次 K3 最超出行业预期的,是代码生成与开发相关能力。摩根士丹利汇总多套专业编程测试数据,差距一目了然:
1.Terminal Bench 2.1 测试:K3 88.8 分,大幅甩开其余国产模型;
2.FrontierSWE 贴近真实软件开发场景测试:得分 77.6 分,和海外顶尖模型差距极小;
3.SWE Marathon 高难度长周期编程测试:拿到 42 分,显著高于 GLM-5.2 的 35 分。
To B 行业里,编程开发场景客户付费意愿最强、客单价最高。此前行业普遍认为国产大模型短板集中在代码、复杂推理领域,而 K3 在多项专业编程测试跻身全球前列,说明国内模型在专项能力迭代速度远超市场预期。这类能力无法单纯依靠堆砌参数实现,需要在训练数据筛选、指令微调、模型对齐等细节持续打磨。
五、行业长期判断:K3 只是产业发展起点
研报重点提到,不能把 K3 看作突然诞生的技术奇迹,它是国内 AI 产业多年持续积累的成果。今年 6 月发布的 GLM-5.2,已经验证国内模型具备对标海外的基础实力。
大模型赛道不存在短期弯道超车,从百亿参数、千亿参数再到如今 2.8 万亿参数,从落后追赶到局部能力领先,背后依靠完整算力供应链、海量行业数据、成熟 AI 人才体系的长期沉淀。
机构预判,后续国内会批量诞生更大参数、更高定价、更强综合性能的大模型,国产 AI 整体全球竞争力还会持续提升,K3 仅仅是产业升级的开端。
更多分析可点击关注查看:
整理不易,记得关注、点赞、随手分享哦。