⭐🚩 Learning Where Outcomes Change: Credit-Addressable Reasoning for Multimodal Geometry
Published in Arxiv, 2026
Arxiv地址:https://arxiv.org/abs/2608.30457
GitHub:https://github.com/gjn12-31/CE-GRPO
1. 关键词 (Keywords)
- 多模态几何推理 / Multimodal Geometry Reasoning
- 可寻址信用分配 / Credit-Addressable Reasoning
- 可执行感知代码 / Executable Perception Code
- 关键事件组相对策略优化 / Critical-Event Group Relative Policy Optimization (CE-GRPO)
- 事件级信用分配 / Event-Level Credit Assignment
- 共享前缀反事实分支 / Shared-Prefix Counterfactual Branching
- 视觉语言模型强化学习 / Reinforcement Learning for VLMs
2. 背景与动机 (Background & Motivation)
多模态几何推理的两个耦合瓶颈
几何题对视觉语言模型提出了一个很苛刻的要求:模型不仅要从图中读出点、线、角、垂直和平行等精细关系,还要在多步推导中持续、正确地使用这些关系。一次对象绑定错误、角度理解错误,或者没有依据的辅助线构造,都可能让后续推理整体失效。
现有自由文本思维链把关键视觉决策隐藏在连续自然语言中,形成了两个相互强化的问题:
- 表示缺口:真正决定答案的感知、引用和构造没有稳定、可检查的语义单元;
- 信用缺口:轨迹级强化学习只给整条回答一个终局奖励,同一个 advantage 被施加到所有 token,无法区分哪一步改变了最终结果。

Figure 1 把论文的核心矛盾画得很清楚:自由文本推理既隐藏了视觉决策,又只能接收整轨迹奖励;论文则先用 Code-CoT 显式暴露事件,再让 CE-GRPO 在这些事件边界比较不同未来,把终局差异转化为局部信用。我们认为这张图最重要的不是流程本身,而是它提出了一个表示与优化必须共同设计的原则。
为什么不是简单地“把图转成代码”
程序辅助推理、形式化几何和细粒度信用分配都不是新问题,但此前两条路线大多彼此分离:代码或形式语言可以暴露结构,却不一定成为优化单位;细粒度 RL 可以寻找关键 token 或步骤,却未必拥有稳定、可验证的语义边界。
论文首先做了一个六模型控制实验,检验代码究竟应该替代图像还是补充图像。结果显示,图像与外部生成代码联合输入在三个开源模型和三个闭源模型上始终最好;对开源模型而言,自生成代码在 code-only 条件下又比外部代码低 11.7–16.6 个百分点。这给出两个直接结论:图像不能丢,自生成代码的可靠性必须被专门训练。

Table 1 报告 MathVerse 五个子集上的六模型均值。图像加代码相对仅图像的绝对增益,在 InternVL3.5-8B、Qwen2.5-VL-7B、Qwen3.5-9B 上分别是 18.4、11.2、5.5 个百分点,在三个闭源模型上也保持正增益。我们据此把 Code-CoT 理解为视觉信息的持久工作区,而不是用符号中间表示替代原始图像。
核心问题:让推理单元同时成为学习单元
论文把目标概括为 credit-addressable reasoning:推理时显式暴露的语义单元,也直接定义训练时从哪里截断历史、在哪里比较替代方案,以及把信用分配给哪段生成。这个定义把“推理结构是否可读”推进到了“推理结构是否可用于优化”。
3. 核心方法:Code-CoT 与 CE-GRPO (Core Methodology)
Code-CoT:保留图像的可执行推理空间
给定图像与问题 x = (I, Q),模型在一次自回归生成中输出:
Y = [C, P, e₁, ..., eL, F]其中 C 是带行号、可执行的 Matplotlib 感知代码,P 是解题计划,F 是最终答案;中间事件来自四种类型:
- think:基于当前状态进行推导;
- reference:引用感知代码中的具体行,为首次使用的图形事实提供依据;
- auxiliary:增加辅助对象或关系,并给出可执行操作;
- coordinate:建立可执行坐标系,为后续计算提供坐标表示。
原始图像在整个生成过程中始终保留。代码不是外部工具返回的固定结果,模型也不在测试时调用几何求解器;同一个策略生成感知代码、事件化推理与最终答案。行号和类型标签同时带来两类能力:程序检查器可以验证代码执行、引用一致性与动作合法性,训练器也可以确定性地恢复任一事件之前的前缀。
两阶段学习:先学协议,再学局部信用
第一阶段使用 18,302 条质量控制后的 Code-CoT 轨迹进行 SFT。数据来自八个几何数据集;每条保留轨迹都要通过结构、执行、引用 grounding、动作合法性和答案正确性检查。图像由 Gemini-3.1-Pro 转写为感知代码,DeepSeek-V4-Pro 再合成计划、事件和答案。
第二阶段从去重后的 11,450 道原始几何问题中在线生成完整轨迹。奖励由答案正确性、动作合法率,以及重复动作、重复生成和答案泄漏惩罚组成;结构无效的响应直接得到 -1,结构有效且答案、动作全部正确时最高为 1.3。因此,方法不需要过程标注或额外 value model,但仍依赖明确的程序化协议奖励。
CE-GRPO:从共享事件前缀比较完整未来
CE-GRPO 的关键不是给单个步骤单独打标签,而是在一个候选事件之前固定完整前缀,重新采样多个一直到最终答案的完整后缀。具有相同图像、问题和前缀的分支构成一个 comparison group,终局奖励的组内差异被标准化为事件条件 advantage;前缀属于 prompt,不进入 policy loss,因此更新只落在被重新生成的事件及其后果上。
若所有续写得到相同奖励,这一组不会产生更新。这个设计很克制:选择器不预先断言某个事件一定“关键”,关键性由共享状态下不同未来是否改变终局结果来揭示。
结构先验与类型归一化熵
候选事件由结构先验与 entropy 联合选择。论文不直接比较不同事件类型的 raw entropy,而是在事件类型内部标准化均值熵:
η(e) = (H̄(e) - μκ(e)) / σκ(e)这一步很必要,因为采集轨迹中 think 事件的平均熵大约是 reference 事件的 7.7 倍。选择器优先考虑第一个完整 think 事件或同类型高熵事件,并从动作事件中选取另一个高熵候选;训练时加入少量随机替换以保留探索覆盖。

Figure 3 串起五个阶段:SFT 安装 Code-CoT 协议,模型生成带行号的感知代码和类型化事件,选择器定位候选边界,共享前缀分支生成反事实未来,最后以 1:1 混合普通问题 prompt 与反事实前缀 prompt。我们认为这一混合很关键:普通组保留全局任务学习,前缀组增加局部信用,两者仍共享同一个 GRPO 目标和程序化奖励。
4. 实验设计 (Experimental Design)
模型、数据与训练配置
Code-CoT SFT 从 Qwen3-VL-8B-Instruct 初始化,冻结视觉编码器,只更新多模态 aligner 和语言模型。SFT 在 8 张 A100-80GB 上训练;CE-GRPO 采用全参数更新,在 64 张 A100-80GB 上以 batch size 64、每题 4 个 rollout、学习率 1e-6、采样温度 0.6 训练,并使用 3,270 个固定共享前缀。普通 prompt 与反事实前缀 prompt 按 1:1 混合。
这个配置也带来一个必须保留的比较边界:不同基线并非完全等算力或等参数更新。DPO、GPO 使用 LoRA,其他多数后训练基线使用全参数更新;CE-GRPO 的 64 卡训练资源也明显高于若干 8 卡基线。因此,主表可以证明完整方法在论文配置下有效,但不能单独回答单位算力收益。
九个几何基准
评测覆盖四类能力、九个基准:
- 视觉 grounding:MathVerse、VisOnlyQA-Syn、VisOnlyQA-Real、MathVista-GPS;
- 平面几何:Geometry3K、PGPS9K、GeoQA;
- 辅助构造:GeoLaux-mini;
- 过程级多模态推理:MM-Math。
总分是九个固定测试集准确率的无权平均。Code-CoT 模型必须以唯一且非空的 <answer> 块结束,否则按错误计;异构答案格式由 Gemini-3.1-Pro-Preview 与 Gemini-2.5-Pro 独立判断,分歧时重复评估直到一致。论文还声明在轨迹合成前移除了训练集与评测集的问题级和图像级重叠。
对比方法
对比包括原生 Qwen3-VL-8B、仅提示和 Code-CoT SFT,DPO、PPO、DAPO、轨迹级 GRPO,以及 SRPO-style、GPO、CFPO、GRPO-MA 等细粒度或反事实后训练方法。论文也评估了外部 7B/8B checkpoint,以及需要额外一次模型调用的 GDP-4B-RL、GeoTikzBridge-8B 两阶段系统。
5. 实验结果与分析 (Results & Analysis)
主结果:提升集中在依赖中间决策的任务

Table 2 给出九个 benchmark 的主结果。原生 Qwen3-VL-8B 平均准确率为 67.95,直接加 Code-CoT prompt 反而降到 49.26,SFT 后恢复并提升到 69.55;这说明结构化协议不能靠提示临时获得,必须被训练进模型。CE-GRPO 达到 76.04,相对原生 backbone、Code-CoT SFT、轨迹级 GRPO 分别提高 8.09、6.49、3.43 个百分点,并在九个基准上都超过原生 backbone。
最有解释力的不是平均分,而是增益分布。相对轨迹级 GRPO,CE-GRPO 在 GeoLaux-mini 和 MM-Math 上分别提高 15.16 和 9.44 个百分点;这两类任务都需要中间构造或多步决策持续影响后续结果。相比之下,部分直接视觉 grounding 与标准平面几何任务提升较小甚至有波动,符合“局部信用主要帮助依赖链更长的任务”这一机制预期。
消融:结构决定在哪里分支,熵决定预算怎么花

Table 5 固定其他组件,只改变候选事件选择信号。随机前缀的平均准确率为 72.48,仅熵为 72.83,仅结构为 74.26,结构加熵达到 76.04。同时,无效终止率从随机前缀的 12.31% 降到组合方法的 4.73%。这表明语义事件边界承担了主要定位作用,而类型归一化熵进一步把有限分支预算投向更可能产生结果差异的候选。
附录的离线选择器验证提供了独立支持:在 300 道题、每条轨迹选两个事件的设置下,结构选择相对随机将 Crit.@2 从 0.222 提高到 0.289,约为 30.2% 的相对提升;加入熵后保持相近 critical-event 命中率,同时把每个关键事件的 token 成本从 85.0k 降至 75.0k。不过,这仍是离线、固定预算下的验证,不能等同于在线训练的完整成本曲线。
Code-CoT 的收益确实进入了视觉表示

Table 4 在 100 道 MathVerse-TD 问题上检查第一个 <perception> 块。仅提示的 backbone、Code-CoT SFT、CE-GRPO 的 diagram-to-code macro recall 分别为 55.21%、70.16%、80.43%,渲染成功率分别为 89.0%、95.0%、99.0%。这说明训练不仅改善最终答案,也提高了感知代码的可执行性和几何事实覆盖。

Table 7 进一步沿 MathVerse 从 Text Dominant 到 Vision Only 的五个版本分析模态差距。CE-GRPO 在 TD 上相对 backbone 略降 0.88 个百分点,却在 VO 上提高 15.10 个百分点,使 TD–VO gap 从 30.07 缩小到 14.09,跨版本标准差从 9.91 降至 4.87。我们据此认为提升主要来自更可靠地保存和复用图中关系,而不是只把文本推理做得更强。
有效输出上的提升与协议边界

Table 6 只在正确闭合 <answer> 的响应上重新计算准确率。CE-GRPO 仍在九个基准中的七个领先轨迹级 GRPO,平均提高 3.91 个百分点,GeoLaux-mini、MM-Math、PGPS9K 的增益分别为 12.53、8.42、5.07。因此,主结果不能简单归因于格式闭合率改善。不过 CE-GRPO 的平均未闭合率为 4.72%,略高于轨迹级 GRPO 的 4.22%,协议可靠性仍不是完全解决的问题。
推理链越长,事件级信用的相对优势越明显

Figure 4 把每个 benchmark 的平均完整事件数与相对 Code-CoT SFT 的增益联系起来。CE-GRPO 相对轨迹级 GRPO 的优势每增加一个中间事件扩大 3.77 个百分点,相关系数 r = 0.866,精确检验 p = 0.0016,留一 benchmark 检验仍显著。轨迹级 GRPO 的收益随事件数显著下降,而 CE-GRPO 的下降趋势较弱且不显著。这是论文最贴近核心机制的证据,但样本单位只有九个 benchmark,仍应视为跨任务相关性而非严格因果证明。
质性案例:错误假设能够被局部抑制

Figure 5 分析一个等腰三角形案例。轨迹级 GRPO 无法隔离“任意 cevian 必然垂直底边”这一错误结构假设;CE-GRPO 从该决策之前分支,使引入中点或使用 Stewart 定理的正确续写获得正奖励,同时抑制无依据的垂直与角平分线假设。这个案例直观展示了“局部信用”如何工作,但它是经过挑选的单个样例,不能替代主表和消融的统计证据。
6. 总结、贡献与边界 (Conclusion, Contributions & Boundaries)
主要贡献
- 提出 credit-addressable reasoning 原则:推理阶段显式暴露的语义单元,同时成为训练阶段比较未来和分配信用的单位。
- 提出 Code-CoT:保留原图,用带行号的可执行感知代码承载视觉关系,再以类型化事件组织引用、构造、坐标化与推导。
- 提出 CE-GRPO:在事件前共享完整前缀,采样多个完整未来,用终局结果差异构造事件条件 advantage,无需过程标注或额外 value model。
- 给出机制一致的实验结果:九基准平均准确率达到 76.04;增益在辅助构造、过程级推理和长事件链上最明显,结构与 entropy 的作用也得到任务级和离线消融支持。