韩国 FINAL-Bench 展示 VKAE 推理加速:同一块 B200 上让 MoE 模型吞吐提升到 23.4 倍
韩国团队 VIDRAFT / FINAL-Bench 在 Hugging Face 发布 VKAE 推理加速结果,强调训练只发生一次,推理才是 AI 服务持续成本。文章给出了可复现实验入口和 Docker 容器,对 AI 基础设施运营很有参考价值。
韩国团队 VIDRAFT / FINAL-Bench 在 Hugging Face 发布了一篇关于 VKAE 推理加速的文章,标题很直接:Adding a GPU Without Building One。它讨论的不是再训练一个新模型,而是如何把已经拥有的 GPU 用得更满。
这件事对 AI 应用很现实。模型训练通常只发生一次,但用户每一次提问、每一行输出、每一次 Agent 调工具,都会持续消耗推理资源。随着网站、企业应用和本地服务的调用量增加,推理成本才是长期运营里最难逃开的账。
同一块 B200 上,MoE 模型吞吐最高提升 23.4 倍
文章给出的核心数据是:在单块 NVIDIA B200、同一测量 harness、baseline serving 与 VKAE optimized serving 对比下,Qwen3.5-35B-A3B 这个 MoE 模型的单流吞吐从 25.7 tok/s 提升到 601 tok/s,提升 23.4 倍。

它还列出几个不同模型的速度变化:Darwin-36B-Opus MoE 提升 11.2 倍,JGOS-398B 大 MoE 提升 4.33 倍,Gemma 4 E4B 提升 5.3 倍,Qwen3.6-27B dense 提升 2.47 倍。
这些数字最值得关注的地方不是“永远提升几十倍”,而是不同模型结构的差异。文章明确指出,MoE 模型在单流解码时更容易受内存带宽限制,因此 serving 层优化收益更明显;大 dense 模型更偏计算受限,收益相对小。
推理优化正在变成 AI 基础设施的核心问题
VKAE 文章把推理优化放到一个很清楚的经济模型里:训练发生一次,推理发生在用户使用产品的整个生命周期。AI 服务能不能盈利,最后会落到 cost per token 上。
这也是为什么 vLLM、TensorRT-LLM、Cerebras、Groq 这类推理优化和推理专用硬件会持续受到关注。模型再聪明,如果每次调用都很贵、很慢、很不稳定,就很难真正变成日常服务。
对个人站点和中小团队来说,这个判断也成立。前期可以先用云 API,把功能跑通;但当访问量上来,朗读、AI 摘要、Agent 导入、自动运营等功能都可能变成持续成本。推理效率迟早会从“技术指标”变成“运营生命线”。
可复现实验比单纯宣传更重要
这篇文章比较值得收录的原因,是它没有只给一个速度宣传。它同时提供了 Docker 入口,声称可以直接拉取容器,在自己的 GPU 上复现实验。
文章给出的示例命令包括:
docker pull vidraft/qwen35-vkae:601
docker run --gpus all -p 8000:8000 vidraft/qwen35-vkae:601
这个细节很重要。AI 基础设施领域里,“我们最快”“我们成本最低”很常见,但真正能被技术社区信任的,往往是能说明 baseline、硬件条件、质量损失和复现实验入口的结果。
对亚洲 AI 基础设施生态的信号
VIDRAFT 在文末介绍自己构建 Korean-focused large language models and AI infrastructure,包括 Darwin、JGOS、推理优化、FINAL Bench 和幻觉降低中间件。它说明亚洲 AI 生态不只是在追模型参数,也在补推理、评测、运营成本这些底层工程环节。
对 HelloAIFlow 的读者来说,这条前沿最直接的学习点是:如果未来你要让 AI Agent 自动运营内容、自动导入 ZIP、自动生成摘要或提供语音朗读,模型能力只是第一步。真正上线以后,推理速度、稳定性、复现能力和成本控制同样是产品能力。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。