← Back to literature explorer
Weakly Supervised From survey PDF — verify links

Multimodal-VAD

Multimodal-VAD — Multimodal Fusion

IEEE TIM · 2025

Survey summary

Dual-stream multimodal VAD network combining video, audio, and text: a coarse-grained stream cross-modally fuses audio with temporally modeled visual features via contrastive optimization, while a fine-grained stream builds abnormal-aware context prompts to discriminate anomalies via a 'coarse-support-fine' strategy.

Weakly Supervised

Weakly SupervisedMultimodal Fusion
Weakly SupervisedAudio-vision-languageIntelligent monitoring