通用视觉自监督研究报
A Daily Digest of Visual Self-Supervised Learning
2026-06-14 图像表征 · VFM · JEPA · 视频预训练
arXiv 新增 + project · P2 · 2026-06-14

Modality Forcing for Scalable Spatial:它和通用视觉自监督的关系在于:把 T2I 预训练的空间先验转成 image-depth 联合生成/估计,支持“生成式预训练可扩展到空间感知”的判断

中高相关;详见方法、贡献和实验边界。

编号2606.13676 优先级P2 类别arXiv 新增 + project 会议arXiv 新增 + project 方法把 T2I 预训练的空间先验转成 image-depth 联合生成/估计,支持“生成式预训练可扩展到空间感知”的判断 来源arXiv / OpenReview

先说结论。它和通用视觉自监督的关系在于:把 T2I 预训练的空间先验转成 image-depth 联合生成/估计,支持“生成式预训练可扩展到空间感知”的判断。 中高相关;详见方法、贡献和实验边界。

(c) Scales with T2I model size Figure 1: We present Modality Forcing, a post-training reci
(c) Scales with T2I model size Figure 1: We present Modality Forcing, a post-training reci(c) Scales with T2I model size Figure 1: We present Modality Forcing, a post-training recipe to extract spatial priors from text-toimage (T2I) models. A single DiT models the joint distribution over images and depth, enabling joint and conditional generation in arbitrary combinations. We demonstrate depth predictions improve with increasingly capable T2I pretraining, suggesting T2I is a scalable objective for spatial generation.这张图来自论文 PDF 的结构化抽取。当前用于辅助理解 Modality Forcing for Scalable Spatial 的方法或实验,请结合正文精读段落一起看。
Neon city plaza at night
Neon city plaza at nightNeon city plaza at night. Figure 2: Modality Forcing generates rich RGB-Depth from text prompts. Unprojecting the points to 3D, Modality Forcing generates faithful and sharp geometry. The same checkpoint enables monocular depth estimation, and depth-to-image generation competitive with the best specialist models.这张图来自论文 PDF 的结构化抽取。当前用于辅助理解 Modality Forcing for Scalable Spatial 的方法或实验,请结合正文精读段落一起看。

核心问题

它和通用视觉自监督的关系在于:把 T2I 预训练的空间先验转成 image-depth 联合生成/估计,支持“生成式预训练可扩展到空间感知”的判断。

方法拆解

把 T2I 预训练的空间先验转成 image-depth 联合生成/估计,支持“生成式预训练可扩展到空间感知”的判断

主要贡献

中高相关;详见方法、贡献和实验边界。

实验看点

实验部分建议重点看两类证据:一是作者是否把方法收益和更强数据、更长训练、更大模型区分开;二是跨模型、跨数据或跨任务迁移是否还能保留同样趋势。

局限与读法

这篇论文的结论需要结合任务设置、训练数据规模和消融实验一起看;不要只凭单个指标判断它对通用视觉表征的价值。