通用视觉自监督研究报
A Daily Digest of Visual Self-Supervised Learning
2026-07-21 图像表征 · VFM · JEPA · 视频预训练
今日主线 · arXiv new/cross; audio-visual JEPA SSL

AV-JEPA:用 early-fusion ViT、modality dropout masking 和 SIGReg,把 JEPA 扩展到音视频 latent 对齐,同时保持无 decoder/无负样本的简洁自监督结构

用 early-fusion ViT、modality dropout masking 和 SIGReg,把 JEPA 扩展到音视频 latent 对齐,同时保持无 decoder/无负样本的简洁自监督结构。

AV-JEPA figure
这张图来自论文 PDF 的结构化抽取。当前用于辅助理解 AV-JEPA 的方法或实验,请结合正文精读段落一起看。

今日推荐论文

全目录 →
AV-JEPA figure
2026-07-21 · arXiv new/cross; audio-visual JEPA SSL · arXiv new/cross; audio-visual JEPA SSL

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

高相关;详见方法、贡献和实验边界。

方法:用 early-fusion ViT、modality dropout masking 和 SIGReg,把 JEPA 扩展到音视频 latent 对齐,同时保持无 decoder/无负样本的简洁自监督结构