Audio-Driven Multi-Person Conversational Video Generation
Transcribe audio to text with optional speaker diarization