Google Research 的 Retrieve-for-Train:绕过推理瓶颈,加速复杂 AI 搜索
Google Research 提出 Retrieve-for-Train,用离线强化学习发现符合奖励目标的查询扩展方式,再将其蒸馏到轻量扩散检索器,以单次推理生成互补的子查询集合。该框架的扩散模型有 53.9M 参数,可直接把查询嵌入映射为完整目标嵌入集合,绕过文本 CoT 推理 token;训练还使用 Gemma3-4B 和 Qwen3-4B。
Google Research 提出 Retrieve-for-Train,用离线强化学习发现符合奖励目标的查询扩展方式,再将其蒸馏到轻量扩散检索器,以单次推理生成互补的子查询集合。该框架的扩散模型有 53.9M 参数,可直接把查询嵌入映射为完整目标嵌入集合,绕过文本 CoT 推理 token;训练还使用 Gemma3-4B 和 Qwen3-4B。
Mistral推出Agentic Search检索层,让AI系统能够跨数据源搜索、浏览和核验复杂文档,并报告其在FinanceBench和OfficeQA Pro上的准确率提升。
推荐理由:文章用 FinanceBench 与 OfficeQA Pro 对比单轮 RAG,展示迭代检索和文档导航对准确率、延迟与 token 消耗的影响。