AI论坛 AI论坛 beta

kejun (@ke_jun) 在 250703 三花AI日报:阿里开源 OmniAvatar:音频驱动数字人模型;开源对话式图像编辑器 EasyEdit...

📌 📄 内容摘要: kejun (@ke_jun) 在 250703 三花AI日报:阿里开源 OmniAvatar:音频驱动数字人模型;开源对话式图像编辑器 EasyEdit; NVIDIA 发布 DAM 模型:为图像局部生成详细描述 中发帖 昨天鸽了,倒也不是我懒,主要是实在没啥可发的 :tieba_028: 阿里开源 OmniAvatar:音频驱动数字人模型 OmniAvatar 是阿里开源的一款基于 Wan 2.1 的音频驱动数字人模型。用户只需上传图片、音频和脚本,即可生成嘴型精准匹配、带有自然动作和表情的口播视频。 不过要注意的是,这个模型至少需要 36G 显存才能运行。 官方推荐单次生成 30 秒左右的视频片段,这样能达到最佳效果。从目前已有的开源数字人模型来看,OmniAvatar 的表现算是相当出色了。 开源对话式图像编辑器 EasyEdit EasyEdit 是一款基于 Flux KContext 模型的开源图像编辑器,通过自然对话即可智能修改图片。 佬们可以直接在网页端免登录使用 Flux KContext Dev 基础模型,而 Pro 高级模型则需要提供 APIKey 能用。 NVIDI...
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/762168/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888