AI论坛 AI论坛 beta

h4ckm310n 在 昨晚尝试了部署Qwen3-235B-A22B-2507 Q2量化 中发帖

📌 📄 内容摘要: h4ckm310n 在 昨晚尝试了部署Qwen3-235B-A22B-2507 Q2量化 中发帖 我的硬件配置是这样的: CPU: AMD R7 7700 内存: DDR5 6400 48G x 2 显卡: RTX 4060 Ti 16G + RTX 5060 Ti 16G 受限于内存,我只能部署Q2量化,这里我使用的是unsloth的UD-Q2_K_XL量化,模型大小将近90G。基本上把内存干满了。我用的部署软件是oobabooga的text generation webui,基于llama.cpp,根据网上抄的配置,开启了flash attention,通过override-tensor=._ffn_.*_exps.=CPU来进行offload,由于激活参数只有22B,Q2量化下显存占用不到7G。 实际简单使用了一下,生成速度在7t/s左右,不知道长上下文下会不会慢很多。尝试调整了override-tensor,将更多的tensor塞给显卡,提高显存占用,但速度仍然差不多。...
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/820550/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888