SARRA 更新摘要

搜索代理即使避开攻击目标，也可能无法正确完成用户问题。历史三种子、1000题比较显示答案监督配置的导出策略具有更高准确率，但训练/导出权重共享问题限制因果归因。

新增作者3B/7B checkpoint开发集比较覆盖256题、7条件。7B在override下目标命中1.95%，但准确率由55.86%降至51.17%。在它已经选择第二次搜索的状态，新检索相对重复旧证据的条件准确率提高9.57、11.89、9.42个百分点。该对照支持这些检索结果的价值，并不证明学会核验、纯粹的新颖性效应或训练方法迁移。完整分母、配对区间和成本见附录J。7B数值导出检查通过，但GRPO smoke初始化失败；尚无7B训练改善结果。
