ShuiHan268/dsh-qwen-mm-plugins
Skill Claude CodeCodex
Cloud MCP tools for understanding media, by model family. VL model: visionchat (caption/VQA), ocr, grounding (detect/locate objects). Omni model (reads frames + audio together): timestamped captioning, ASR (plain / controllable / multi-speaker diarized), temporal grounding, event counting, music captioning. Plus…
2 15d ago A 110 tokens
copy · 100% Apache-2.0