Weakly Supervised From survey PDF — verify links
AVadCLIP
AVadCLIP — Multimodal Fusion
arXiv · 2025Human-reviewed summary status
Survey summary
AVadCLIP is a weakly supervised audio-visual VAD framework built on frozen CLIP: an efficient audio-visual fusion module adapts cross-modal features, an audio-visual prompt enhances text embeddings, and uncertainty-driven distillation synthesizes audio-visual representations from visual-only input at inference.
Taxonomy placement
Weakly Supervised
Weakly SupervisedMultimodal Fusion
Method characteristics
Weakly SupervisedAudio-visual fusionUncertainty distillation