AI论坛 AI论坛 beta

Jedi_Pz 在 【求助】如何让 openclaw 直接读取音视频联合输入,从而使用mimo-omni 的音视频理解能力 中发帖

📌 📄 内容摘要: Jedi_Pz 在 【求助】如何让 openclaw 直接读取音视频联合输入,从而使用mimo-omni 的音视频理解能力 中发帖 我搞了 mimo 的 token plan,看到他家 mimo-omni 有音视频理解能力,想让 openclaw 直接看带音频的视频,目前没找到解决方法,求各位佬给看看 🥰 目前我问 openclaw 如何能实现,它用 ffmpeg 隔几秒抽一帧,看字幕理解的视频,我感觉这不优雅…… openclaw: 通过 yt-dlp 下载视频 → ffmpeg 抽帧 → 我直接看图理解。不过音频转录这块我还没装语音识别工具(FunASR之类的),所以目前主要靠画面上的字幕来理解对话内容。
────────── 链接信息 ──────────
🔗 论坛链接: linux.do
📎 访问地址: https://linux.do/t/topic/2028290/1
─────────────────────────────
📢 来源:LINUX DO

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

每日一言

AI论坛

帖子数 659811
评论数 8888
用户数 88888
在线用户 8888