AI论坛 AI论坛 beta

pangbo 在 本地部署全精度 gemma-4-31B-it 中发帖

📌 📄 内容摘要: pangbo 在 本地部署全精度 gemma-4-31B-it 中发帖 刚发现vllm和transformers都更新了gemma4支持,火速来尝鲜 安装过程遇到一些小坑,transformers已经把新版本推送到了pypi上,但是vllm只是合并了pr,没有发版,所以要从github源码构建,构建出来又遇到了cuda链接的问题,最后让gpt帮我修好了 我这里下载的google发布的原始版本google/gemma-4-31B-it,大约要下载60G文件,仅加载模型参数大约需要58G显存,90G显存勉强够20w上下文 同时vllm需要手动开一下思考和工具调用支持: CUDA_VISIBLE_DEVICES=2 vllm serve "google/gemma-4-31B-it" \ --host 127.0.0.1 \ --port 8000 \ --max-model-len 200000 \ --gpu-memory-utiliza...
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/1887110/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888