AI论坛 AI论坛 beta

炫彩小鱼干 (@Yuookie) 在 究极花瓶:配上新的草稿模型,gemma-4-31B 可达 123 tokens/s,但上下文…… 中发帖

📌 📄 内容摘要: 炫彩小鱼干 (@Yuookie) 在 究极花瓶:配上新的草稿模型,gemma-4-31B 可达 123 tokens/s,但上下文…… 中发帖 使用了谷歌最新发布的草稿模型gemma-4-31B-it-assistant,加上gemma-4-31B-it-4bit-W4A16-AWQ部署在vllm上 draft tokens开到5,代码场景123tokens/s [image] 知识问答类67tokens/s [image] [image] 只恨我的4090显存不够啊~上下文只能开到2816,没错就是2k 如果有5090就可以爽玩了
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/2131401/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888