AI论坛 AI论坛 beta

布洛妮娅总裁 (@Bronya) 在 MTP 太强了!为什么 Gemma4 不支持 MTP... 中发帖

📌 📄 内容摘要: 布洛妮娅总裁 (@Bronya) 在 MTP 太强了!为什么 Gemma4 不支持 MTP... 中发帖 最近在尝试本地部署 Qwen3.6-27B 和 Gemma4-31B,发现因为是 Dense 模型,两者的生成速度都挺慢(相比 200多 B 的 MoE 模型而言,速率还低了一半,只有约 25-30 token/s)。但是我发现 Qwen3.6 支持 Multi-Token Prediction (MTP) 功能,在 vllm 上尝试了一下,发现 TPS 直接提高到了 50-55,我的天 :tieba_030:! 但是我看 Gemma4 官方模型不支持 MTP,如果 Gemma4 能达到这个速率的话我感觉还是 Gemma4 更好了 :tieba_030:。如果要提高 TPS 的话还有什么办法呢 🧐
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/2068328/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888