← Back to literature explorer
Weakly Supervised From survey PDF — verify links

CLIP-TSA

CLIP-TSA — Vision-Language Adaptation

ICIP · 2024

Survey summary

Uses ViT-encoded CLIP visual features in place of C3D or I3D, then models temporal dependencies with a Temporal Self-Attention module to nominate snippets of interest for weakly supervised anomaly localization.

Weakly Supervised

Weakly SupervisedVision-Language Adaptation
Weakly SupervisedCLIPTemporal self-attention