Weakly Supervised From survey PDF — verify links
CLIP-TSA
CLIP-TSA — Vision-Language Adaptation
ICIP · 2024Human-reviewed summary status
Survey summary
Uses ViT-encoded CLIP visual features in place of C3D or I3D, then models temporal dependencies with a Temporal Self-Attention module to nominate snippets of interest for weakly supervised anomaly localization.
Taxonomy placement
Weakly Supervised
Weakly SupervisedVision-Language Adaptation
Method characteristics
Weakly SupervisedCLIPTemporal self-attention