Figureure 2 · : Overview of ReasonCLIP-58M & RCLIP-BenchFig. 2: Overview of ReasonCLIP-58M & RCLIP-Bench. ReasonCLIP-58M provides visually grounded reasoning supervision for CLIP-style models. Built from a refined version of CC12M [9], it comprises ReasonLite-42M for open-form reasoning and ReasonPro-16M for category-specific reasoning. We also introduce RCLIP-Bench, a dedicated benchmark for three-level evaluation of visually grounded reasoning. We report the token and word distributions for each dataset.这张图概括 ReasonCLIP-58M 的整体方法流程。阅读时先看模块之间传递的训练信号,再看作者如何把目标拆成可优化的子问题。Figureure 3 · : Overview of the ReasonCLIP training frameworkFig. 3: Overview of the ReasonCLIP training framework. ReasonCLIP uses a stage-wise continual pretraining strategy that progressively integrates reasoning capacity into the visual encoder while preserving its foundational semantic alignment, enabling seamless integration as a drop-in backbone in MLLMs.这张图概括 ReasonCLIP-58M 的整体方法流程。阅读时先看模块之间传递的训练信号,再看作者如何把目标拆成可优化的子问题。