← Back to literature explorer
Training-Free From survey PDF — verify links

MCANet

MCANet — Multimodal Caption-Aware

ICPR · 2024

Survey summary

Multimodal caption-aware training-free VAD combining visual, audio, and language cues via a large language model.

Training-Free

Training-FreeMultimodal Caption-Aware
Training-FreeMultimodalCaption-awareAudio