← Back to literature explorer
Weakly Supervised From survey PDF — verify links

AVadCLIP

AVadCLIP — Multimodal Fusion

arXiv · 2025

Survey summary

AVadCLIP is a weakly supervised audio-visual VAD framework built on frozen CLIP: an efficient audio-visual fusion module adapts cross-modal features, an audio-visual prompt enhances text embeddings, and uncertainty-driven distillation synthesizes audio-visual representations from visual-only input at inference.

Weakly Supervised

Weakly SupervisedMultimodal Fusion
Weakly SupervisedAudio-visual fusionUncertainty distillation