📌 📄 内容摘要:
最上川 (@artorius) 在 腾讯发布了首个 Diffusion 大语言模型 WeDLM-8B 中发帖
在数学推理任务中,相比经 vLLM 优化的 Qwen3-8B,速度提升 3–6 倍
在大多数基准测试中,性能超越原始的 Qwen3-8B-Instruct
原生支持 KV Cache(兼容 FlashAttention、PagedAttention、CUDA Graphs)
[image]
[image]
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1376931/1
─────────────────────────────
📢 来源:LINUX DO