Kimi K3 发布:2.8 万亿参数与“鹈鹕测试”的启示
中国 AI 实验室 Moonshot AI 发布了 Kimi K3,称其为“迄今最强模型”,参数规模为 2.8 万亿。目前该模型已可通过网页和 API 使用,并承诺在 2026 年 7 月 27 日前开放权重。
Moonshot 将 Kimi K3 称为首个“开放 3T 级模型”。这里的 3T 应是将 2.8 万亿参数向上取整后的说法。按这一口径,它超过了 DeepSeek 1.6T 参数规模的 v4 Pro。
根据 Moonshot 自报的基准结果,Kimi K3 在多数项目上超过 Claude Opus 4.8 max 和 GPT-5.5 high,但落后于 Claude Fable 5 和 GPT-5.6 Sol。
第三方评测机构 Artificial Analysis 对该模型给出了一些值得注意的结果:
- 在其私有的长周期知识工作评测中,Kimi K3 总体 Elo 为 1547,比 Kimi K2.6 高 732 分,仅次于 Claude Fable 5。
- 单任务成本为 0.94 美元,接近 GPT-5.6 Sol 的 1.04 美元,约为 Opus 4.8 的一半,但高于其他开放权重模型。
- 在 Artificial Analysis Intelligence Index 上,Kimi K3 的输出 token 用量显著下降,比 Kimi K2.6 少 21%。
此外,Kimi K3 目前在 Arena.ai 的前端代码竞技场中排名第一,超过了 Claude Fable 5。
定价:更贵的中国大模型
Kimi K3 的价格也很突出:
- 输入:每百万 token 3 美元
- 输出:每百万 token 15 美元
这一价格与 Anthropic Claude Sonnet 系列大致处于同一档,也使其成为目前中国 AI 实验室发布的最昂贵模型之一。相比此前 Kimi K2.6 的每百万输入 0.95 美元、输出 4 美元,涨幅明显。
参数规模方面,Kimi K3 的 2.8 万亿参数也超过 Kimi K2.6 约 1 万亿参数规模的两倍。
“骑自行车的鹈鹕”测试
作者使用 OpenRouter 调用 Kimi K3,让模型完成一个简单任务:
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'
这个提示要求模型生成“一只骑自行车的鹈鹕”的 SVG。
结果显示,这次生成消耗了:
- 输入 token:95
- 输出 token:16,658
- 其中推理 token:13,241
- 总成本:约 0.25 美元
对于这样一个看似简单的 SVG 任务来说,成本并不低。
由于 Kimi K3 支持图像输入,作者又把生成出的 SVG 渲染图交给 Kimi K3,让它生成图像描述。模型返回的描述大意为:
一幅卡通插画:一只白色鹈鹕戴着红围巾,骑着红色自行车沿灰色道路前进,道路上有白色虚线;鹈鹕有橙色大喙和橙色蹼足,正在踩踏板,身后有白色运动线;背景包括浅蓝天空、白云、黄色太阳、两只飞行的小黑鸟,以及前景中的绿色草地和白色小花。
这次视觉描述任务成本约为 0.006 美元。作者认为,Kimi K3 的视觉理解表现不错,生成的替代文本质量较高。
这个测试还能说明什么?
“生成一只骑自行车的鹈鹕 SVG”这个测试已经存在 21 个月。它一开始并不是严肃基准,更像是对模型比较困难程度的玩笑。但在早期一年里,它和模型整体能力之间曾出现过一定相关性。
不过,这种相关性现在已经明显减弱。比如 GPT-5.6 和 Claude Fable 5 在这个任务上的结果,被 GLM-5.2 超过;但作者并不认为 GLM-5.2 因此就是 Claude Fable 5 同级别模型。
作者也不认为主流实验室正在专门针对“鹈鹕骑车”训练模型。如果真是这样,结果理应更好。当然,也不排除某些模型对“动物 + 交通工具”这类组合有过优化。
更重要的是,这个测试并不能覆盖当下模型最关键的能力:
- 智能体式工具调用
- 长对话中的工具稳定操作
- 多步骤任务执行可靠性
因此,作者明确提醒:不要用“鹈鹕测试”来严肃比较模型。
但它仍然有实用价值
尽管如此,作者仍然会继续运行这个测试,因为它至少能提供几个方面的信息。
首先,它是一个强制自己实际调用模型的方式。如果作者展示了某个模型生成的鹈鹕,就意味着他确实把提示跑通了。对于有官方 API 的模型,会优先使用官方 API;对于开放权重且能在本地设备上运行的模型,则会尝试用 llama.cpp、LM Studio 或 Ollama 等工具本地运行;有时也会通过 OpenRouter 这类服务间接调用官方 API。
其次,一个简单提示也可能暴露模型特征。以 Kimi K3 为例:
-
目前似乎只有一种推理强度:“max”
这在 token 用量上非常明显。模型消耗了 13,241 个推理 token,最终输出 3,417 个响应 token。一次简单 SVG 生成花费约 0.25 美元。 -
输入 token 计数偏高
“Generate an SVG of a pelican riding a bicycle”这个提示,在 OpenAI tokenizer 中约为 10 个 token;Anthropic 的不同模型计数在 10 到 30 个 token 不等。但在 Kimi K3 中计为 95 个输入 token。另有用户测试发现,向 Kimi K3 输入“hi”会计为 86 个 token,这暗示可能存在约 85 个 token 的隐藏系统提示。不过模型拒绝泄露相关内容。 -
视觉能力表现良好
Kimi K3 对生成图像的描述准确、细节丰富,说明其图像输入能力可用。
一个“Hello World”式模型检查
作者总结称,这个测试真正的价值并不是排名,而是作为一种轻量级检查:
- 它相当于大模型提示调用的“Hello World”。
- 它能粗略估计简单任务的成本和推理 token 消耗。
- 它可以确认模型是否能输出有效 SVG,并具备基本几何与空间理解能力。
- 对同一模型家族的不同版本进行比较时,仍然有一定观察价值。例如 Kimi K3 的鹈鹕结果相比 Kimi 2.5 有明显提升。
- 它是一种可分享的“我确实试过这个模型”的证据。
总体来看,Kimi K3 的发布展示了 Moonshot AI 在超大参数开放模型上的进一步推进:参数规模、基准成绩、视觉能力和前端代码表现都值得关注。但它的高价格、推理 token 消耗,以及当前推理强度选择有限,也提示开发者在实际使用中需要认真评估成本与任务收益。
