Training-Free From survey PDF — verify links
MCANet
MCANet — Multimodal Caption-Aware
ICPR · 2024Human-reviewed summary status
Survey summary
Multimodal caption-aware training-free VAD combining visual, audio, and language cues via a large language model.
Taxonomy placement
Training-Free
Training-FreeMultimodal Caption-Aware
Method characteristics
Training-FreeMultimodalCaption-awareAudio