Kimi K3 不止跑分第一:它实际做出了芯片、编译器和引力波分析

Kimi K3 发布后不只是跑分登顶——它在 48 小时内自主设计了一颗 45nm 芯片,从零写了 GPU 编译器 MiniTriton,用两小时复现了天体物理 I-Love-Q 关系。本文梳理 K3 展示的长程 Agent 项目案例、社区实测与独立评测的距离。

浏览 83
Kimi K3 不止跑分第一:它实际做出了芯片、编译器和引力波分析封面

月之暗面在 2026 年 7 月 17 日发布 Kimi K3 后,舆论焦点很快集中在"2.8 万亿参数"和"Code Arena 登顶"上。但比起跑分数字,更值得看的是官方技术博客里展示的一批实际项目:K3 不只是回答问题,它在 48 小时内自主设计了一颗芯片,从零写出了一个 GPU 编译器,用两小时完成了通常需要一到两周的天体物理研究复现。Kimi K3 官方技术博客把这些案例称为"长程 Agent 能力"的证明——模型不只是写一段代码,而是能持续工作、调用工具、验证结果并修正自身。这些案例的数据主要来自发布方自测,但它们展示的方向比单一基准分数更值得关注。

Code Arena 盲测登顶,马斯克留下一个词

K3 发布几小时后,在 Arena AI 的前端编程竞技场 Code Arena 上拿到 1679 分,超过此前排名第一的 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分),前端 7 个细分方向拿下 6 个第一。东方财富网报道称马斯克在 X 上对此只留了一个词:Impressive。中信建投研报则将其称为"国产模型的 DeepSeek 时刻"——中国大模型第一次以竞争威胁身份进入全球叙事。Code Arena 是用户匿名真实投票的盲测,含金量高于厂商自评。但需要注意,它主要测前端编程,不能代表全场景编码能力。

从零写出一个 GPU 编译器

官方博客中最具工程说服力的案例是 MiniTriton。K3 不是优化几个现有算子,而是从零构建了一个类 Triton 的紧凑编译器:自带 tile 级中间表示(IR over MLIR)、优化 pass 和 PTX 代码生成管线。Kimi K3 官方技术博客称,在支持的 roofline 基准上,MiniTriton 性能达到或超过 Triton 和 torch.compile,部分负载甚至超过 Triton。更关键的是,MiniTriton 能支撑 nanoGPT 的端到端训练并保持稳定收敛,损失曲线与参考线仅有微小偏差。这说明 K3 能构建从 DSL 前端、IR pass 到 PTX 代码生成和运行时的完整编译器,而不是孤立的内核片段。不过,这些结果仍来自发布方限定环境,尚未有第三方在更多算子、硬件和工程约束下复测。

48 小时自主设计一颗 45nm 芯片

官方博客里最抓眼球的案例是芯片设计。在一次 48 小时的自主运行中,K3 使用开源 EDA 工具在 Nangate 45nm 工艺库上构建、优化并验证了一颗芯片——这颗芯片服务于基于 K3 自身架构的 nano 模型。在 4 mm² 面积内,芯片以 100 MHz 闭时序,模拟中实现超过 8700 tokens/s 的解码吞吐,包含 1.46M 标准单元、0.277 MB SRAM 和带融合反量化的 INT4 MAC 阵列。Kimi K3 官方技术博客把它概括为"A chip built by a model, for a model"(模型为模型造芯)。这是一个概念验证,不代表能直接流片;但它证明 K3 的长程 Agent 能力可以跨入硬件设计领域,持续调用 EDA 工具链并完成可验证的物理设计。

两小时完成通常需要两周的天体物理研究

在科研复现方面,K3 展示了从文献到可执行代码的完整闭环。官方称,K3 用约两小时完成了通常需要一位有经验研究者一到两周的工作:复现计算天体物理中的 I–Love–Q 普适关系。它审阅并交叉验证了 20 余篇论文,实现完整数值管线,评估 300 余个状态方程,发现已发表公式中的不一致,生成 3000 余行 Python 代码,并产出可交互的 HTML 看板用于探索结果。

天体物理研究桌面场景
天体物理研究桌面场景

*图:Kimi 官方博客配图,以复古科学桌面场景呼应天体物理研究主题。图中轨道图、量角器和恒星时记录表等元素象征科研测量工作;实际 I–Love–Q 复现产出为 Python 代码和交互式看板,非图中实物。*

这个案例的意义不在于物理结论本身,而在于模型能跨越"读论文—写代码—验证—发现矛盾"的完整研究工作流。官方也坦率说明,这是 K3 团队内部案例,不代表所有科研任务都能达到同样效率。

产业研究与引力波分析的 Agent 实践

K3 在 Kimi Work 中展示了多个知识工作案例。一个交互式产业研究网站覆盖了 42 年 AI ASIC 产业史,通过 120 余轮递归自改进生成,调用 2800 余次网页搜索和 1100 余次终端数据拉取,覆盖 87 份季度报告和 99 份原始 PDF。另一个案例是 GWTC-5 引力波事件分析:使用 20 余个并发子 Agent 分析 391 个引力波事件,产出 7 个科学可视化、2 个表格和基于 10 余篇论文的文献综合。还有一份核聚变产业研究报告,包含时间线、漏斗图和甘特图等咨询风格可视化。

引力波分析艺术化可视化
引力波分析艺术化可视化

*图:Kimi 官方博客配图,以艺术化方式呈现双致密天体合并产生的引力波"啁啾"信号。实际 GWTC-5 分析产出为科学可视化和文献综合,非此艺术图。*

这些案例的共同特点是:模型不再只是回答单个问题,而是以多 Agent 协作方式完成需要大量信息检索、数据整合和可视化呈现的复合任务。Kimi Work 同时推出了 Widgets 和 Dashboard 功能,允许在聊天内生成交互组件并组织成持久化看板。

3D 创作与视频剪辑

K3 的 3D 和视频能力来自编码、视觉理解和长程执行的组合,而非独立的生成模型。官方展示了多个 3D 交互场景,包括一个体素风格的古罗马竞技场——在浏览器中实时渲染,显示 120 FPS 和近 4 万体素。K3 通过"vision in the loop"机制迭代:写代码后截图观察布局、光照和碰撞,再修改代码。在视频方面,K3 制作了 3Blue1Brown 风格的自身架构讲解动画,将技术概念转化为动画图表和过渡;还从 56 个素材片段剪辑了自己的预告片,处理片段选择、运动匹配剪切、帧精确节拍同步和音频处理。官方称这类高密度短视频通常需要资深剪辑师一到两个工作日。

社区实测与独立验证的距离

K3 发布后,社区也快速产出实测。有网友用 K3 做出仿苹果系统风格的页面,可以进入 App Store 下棋、去 Music 播放音乐。Artificial Analysis 独立模型评测给 K3 的 Intelligence Index 评分为 57,在 189 个模型中排第 4,但输出速度约 62 token/秒,排名第 90——模型明显偏长、偏慢。该机构同时指出,K3 对完整思考历史比较敏感,从其他模型中途切换可能明显掉质;模糊任务中可能过度主动,替用户做出未授权决定。完整权重计划在 7 月 27 日前发布,技术报告尚未公开。

现阶段最稳妥的判断是:K3 展示的项目案例确实超出了"写一段代码"的传统编码模型边界,芯片设计、编译器构建和科研复现指向的是长程自主工作能力;但这些案例主要来自发布方自测,独立复测和完整权重公布后才能判断它们的可复现性。对于想验证 K3 的团队,优先选择可验收的任务——给定明确输入和验收标准,检查代码结构、测试覆盖和资源许可,而不是只看最终截图。

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

83