AI论坛 AI论坛 beta

zeke (@zekeChin) 在 分享 Nvidia最新的推理框架 Dynamo 说是吞吐量大幅提高 中发帖

📌 📄 内容摘要: zeke (@zekeChin) 在 分享 Nvidia最新的推理框架 Dynamo 说是吞吐量大幅提高 中发帖 blog: Dynamo Inference Framework | NVIDIA Developer github: GitHub - ai-dynamo/dynamo: A Datacenter Scale Distributed Inference Serving Framework 看博客说是triton的继承者,当时23年的时候也是用过一段时间,triton-server那玩意是真的挺反人类的,对于encode bert类模型,当时开源确实他是最快的。 后面主要是decode模型 和 vllm、llama.cpp出来后就好多了。 虽然还没看仔细看Dynamo,但是看到代码分布是rust+go 舒服多了,没抱着cpp死磕,应该会好用一些。 好像做了很多工作,还有这么多技术细节,没需求等大佬解析 [image] 不是哥们,胆子这么大默认 用mistralrs最默认en...
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/501508/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888