Weakly Supervised From survey PDF — verify links
Multimodal-VAD
Multimodal-VAD — Multimodal Fusion
IEEE TIM · 2025Human-reviewed summary status
Survey summary
Dual-stream multimodal VAD network combining video, audio, and text: a coarse-grained stream cross-modally fuses audio with temporally modeled visual features via contrastive optimization, while a fine-grained stream builds abnormal-aware context prompts to discriminate anomalies via a 'coarse-support-fine' strategy.
Taxonomy placement
Weakly Supervised
Weakly SupervisedMultimodal Fusion
Method characteristics
Weakly SupervisedAudio-vision-languageIntelligent monitoring