📌 📄 内容摘要:
rt,实验室有8卡gpu集群若干:包括4090、pro6000、a100、h800等。实验室其实有几个需求吧:(1)多机训练大模型,例如多台h800集群;(2)弹性分配4090gpu或者a100gpu给某个租户去日常调试代码啥的;(3)部署模型,例如64g的魔改a100多台服务器。其实也调研过,slurm、k8s、
────────── 链接信息 ──────────
🔗 论坛链接: www.nodeseek.com
📎 访问地址: https://www.nodeseek.com/post-504445-1
─────────────────────────────
📢 来源:NODESEEK