270亿参数压到11.8GB:Qwen3.8-27B这款IQ3_S,值得16GB显卡用户换吗?

奥地利 ISTA 团队把量化精度按张量重新分配,推出11.8GB的GSQ-RCO IQ3_S。它在发布方部分测试中接近BF16,但并非全面无损;本文核对四个IQ3文件、MTP开销与真实跑分,说明16GB显卡用户该比较什么。IQ3_S于9月1日加入仓库,本文于9月14日复核,不是近五天首发。

浏览 21
270亿参数压到11.8GB:Qwen3.8-27B这款IQ3_S,值得16GB显卡用户换吗?封面

对16GB显卡用户,模型选型常常像搬家:家具想带齐,房间却只有这么大。量化可以把“家具”压小,但压过头,又可能损失做事的细节。奥地利 ISTA 团队发布的 Qwen3.8-27B GSQ-RCO IQ3_S,值得关注的不是又一个三位量化文件,而是它把有限精度重新分配给不同权重,让容量和能力之间多了一个可选位置。发布方模型卡

先校正时间:仓库创建于2026年8月28日,11.8GB的IQ3_S于9月1日加入,最近一次仓库更新是9月2日。本文于9月14日复核,是部署选型解读,不是近五天首发报道。原始提交记录

不是重新教模型一门本领,而是精打细算地分配精度

这里的团队是奥地利科学技术研究院 ISTA 的 DASLab;其官方组织页与模型卡都指向相同的研究团队。GSQ论文首次提交于4月20日,RCO论文首次提交于5月1日,二者不是9月才出现的新方法。团队主页 · GSQ论文 · RCO论文

可以把两个方法理解成搬家时的两个岗位:GSQ负责把每件家具压缩得更妥当,RCO负责决定哪些东西多留一点空间、哪些可以压得更小。 技术上,GSQ优化低精度标量量化的取值与尺度;RCO在总容量预算约束下,为不同张量选择不同量化类型。文件仍是标准GGUF,但内部并非每块权重都使用同一种精度。模型卡的方法与构建流程

所以它应称为量化优化与混合精度分配,不能直接写成“奥地利团队把模型微调得更聪明”。优化过程可以利用任务损失与梯度,但目的仍是控制压缩误差,而不是证实新增了某种职业能力。模型卡也明确把与基础模型的关系标为量化。

IQ3_S、IQ3_XXS和MTP,究竟下载哪一个?

以下是仓库实际文件,不是估算显存。GB采用十进制;括号中的字节数来自原仓库文件接口,MTP文件比对应普通文件增加约0.35GB。文件清单 · 文件元数据

文件后缀下载体积如何理解
IQ3_XXS约10.1GB(10,094,357,632字节)普通版本整文件平均约3.00位,给运行时多留空间
IQ3_XXS-mtp约10.4GB(10,442,827,840字节)在上一个版本上加入多词元预测头
IQ3_S约11.8GB(11,771,546,784字节)普通版本整文件平均约3.50位,发布方推荐的质量档位
IQ3_S-mtp约12.1GB(12,120,016,960字节)更大的文件不代表额外学会了新知识

MTP来自 Multi-Token Prediction(多词元预测,发音 mul-tee TOH-kun pri-DIK-shun)。可以理解成先拟几个后续字词,再由主模型检查;是否真正提速,还取决于推理软件是否支持、是否启用,以及候选词被接受的比例。文件名带MTP,不等于你的启动器已经自动使用它。 发布方称对应版本的主体权重相同,但这不构成本站对不同软件输出一致性或速度的实测证明。模型卡的MTP说明

发布方提供的MTP推测解码图
发布方提供的MTP推测解码图

*图:DASLab模型卡中的MTP测试图,上半部是候选接受率,下半部是输出速度。源图标注llama.cpp、每轮3个候选、每类5个样本,却未在图中列出硬件和完整上下文环境;这里用于说明接受率随任务变化,不能把图中约100—120词元/秒套到RTX 5070 Ti。*

“接近原模型”有数字支持,“全面无损”没有

模型卡把IQ3_S称为“任务无损”。把具体分数摊开看,这句话的范围就清楚了:AIME25和LiveCodeBench v6在公布结果中与BF16相同,GPQA-Diamond仍低0.51分;三项算术平均为91.70,对应BF16的91.87。99.8%只是这三项平均分的比值,不是99.8%的所有能力都保住了。发布方结果表

发布方测试BF16GSQ-RCO IQ3_SUD-IQ3_S
AIME25100.00100.0096.67
GPQA-Diamond89.9089.3989.90
LiveCodeBench v685.7185.7184.00
发布方三项任务平均分与平均位宽对比
发布方三项任务平均分与平均位宽对比

*图:DASLab原始任务均值图。横轴是平均位宽,纵轴是指定任务的平均分;它不是通用能力排行榜,也不衡量真实项目返工成本。*

发布方AIME25对比图
发布方AIME25对比图

*图:发布方AIME25结果。此项持平不能推出其他数学题、中文工作任务或多轮对话同样持平。*

发布方GPQA-Diamond对比图
发布方GPQA-Diamond对比图

*图:发布方GPQA-Diamond结果。此项恰好说明GSQ-RCO没有在所有维度上超过UD量化。*

发布方LiveCodeBench v6对比图
发布方LiveCodeBench v6对比图

*图:发布方LiveCodeBench v6结果。代码题分数有参考价值,但不能替代在完整代码仓库中执行工具、修复问题和通过验收的测试。*

还有一个容易混淆的指标:模型卡的“恢复率”取的是五项零样本测试均值相对BF16的比例,不是上面三项平均值。某个比例超过100%,不代表量化普遍增强了模型。当前卡片也没有完整列出上述每项推理测试的采样次数、生成参数和置信区间,因此本文将这些数字视为发布方报告,不评选“全网最强”。

11.8GB文件能放下,不等于16GB显存已经够用

磁盘文件相当于搬家纸箱,运行显存相当于展开家具后的房间。除了权重,推理还要为上下文缓存、中间计算、运行库和其他占用留空间;若做看图任务,仓库另有约0.93GB的BF16视觉编码器与投影器,其文件体积同样不能直接当作运行开销。视觉文件与使用说明

11.8GB文件约合10.96GiB,这只是单位换算;不能用“16减11.8”就宣布剩余空间能承载多少上下文。上下文长度、并发、缓存精度、是否启用视觉、具体推理版本,都必须在实际环境下另测。本文没有在RTX 5070 Ti上运行这些文件,不承诺128K、192K或256K上下文,也不承诺某个每秒词元数

本站的选型判断是:若你当前更大的量化版本挤占了运行空间,IQ3_S值得加入对照;若空间优先于少量分数差异,10.1GB的IQ3_XXS也是有依据的备选。若现有模型已经稳定完成工作,则没有理由仅凭文件名立即替换。

更有效的比较,是保留旧模型,固定提示词、上下文和采样设置,用自己的需求文档、结构化输出和代码修改任务逐项核对:是否漏约束、是否正确调用工具、最终成果能否通过独立检查。这款量化的价值是多一个更省空间的候选,不是一张免验收通行证。

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

浏览 21
AI 基础设施 NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”封面 NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化” 可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。 47