Qwen3-Omni CaptionerAlibaba CloudQwen3-Omni-Captioner automatically generates accurate and comprehensive descriptions for complex audio, including speech, ambient sounds, music, and sound effects. The model can identify speaker emotions, musical elements, and is suitable for audio content analysis, security audits, and audio editing. Supports audio input up to 40 minutes (1 second = 25 tokens).
Learn More →