AI论坛 AI论坛 beta

yeyucca 在 Nemotron 3 Super 120B的kv cache显存占用比 Qwen 3.5 122B轻量3倍 中发帖

📌 📄 内容摘要: yeyucca 在 Nemotron 3 Super 120B的kv cache显存占用比 Qwen 3.5 122B轻量3倍 中发帖 Nemotron-3-Super (100万 Token):在 16-bit 下只需约 7.63 GB 显存。 Qwen 3.5 122B (100万 Token):在 16-bit 下需要约 22.89 GB 显存(是 Nemotron 的 3 倍)。 对生产力更加友好,阿里和国产赶紧追上来啊~ 1M tokens → 7.63 GiB BF16 / 3.81 GiB FP8 262k tokens → 2.00 GiB BF16 / 1.00 GiB FP8 We can almost forget there is a KV cache. For comparison, Qwen3.5-122B-A10B has 12 full-attention layers, head-dim 256, and works out to 24,576 bytes/token in B...
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1740710/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888