AI论坛 AI论坛 beta

实验室多机gpu自建集群一般用啥架构啊?

📌 📄 内容摘要: rt,实验室有8卡gpu集群若干:包括4090、pro6000、a100、h800等。实验室其实有几个需求吧:(1)多机训练大模型,例如多台h800集群;(2)弹性分配4090gpu或者a100gpu给某个租户去日常调试代码啥的;(3)部署模型,例如64g的魔改a100多台服务器。其实也调研过,slurm、k8s、
────────── 链接信息 ──────────
🔗 论坛链接: www.nodeseek.com
📎 访问地址: https://www.nodeseek.com/post-504445-1
─────────────────────────────
📢 来源:NODESEEK

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888