随想

从广告排序到 Agent 工具决策:我和 AI 完成一篇 arXiv 工作论文的过程

起点:一个来自广告算法的研究问题

最初我想做的是 Agent 的工具排序、路由与成本优化。广告排序里的“上下文—候选动作—有限反馈”视角提供了切入点:Agent 面对多个工具时,应该选择哪一个、花多少钱、何时弃权?但工具权限和业务风险不能像点击率那样交给一个分数去权衡。我们把问题收窄为单次决策中,面对固定的完整工具调用候选,如何在权限、效用与成本约束下评价选择策略。

AI 在这段研究里做了什么

AI 首先协助我比较研究方向,结合我熟悉的广告算法与离线评估,聚焦到工具排序、路由和成本。随后它把想法整理成研究需求文档:明确问题边界、日志和倾向概率、对照基线、权限门控、实验矩阵、可复现产物与失败条件。在论文公开后,我又让 AI 阅读正文和仓库,逐项核对准备对外讲述的结论。研究问题的取舍、实验及论文结论以署名论文和公开代码为准;AI 是研究辅助工具,不能代替实验结果或同行评审。

从方案到可以被推翻的实验

我们实现了 11 个可执行的企业场景工具,使用精确倾向概率的随机日志、独立重置的环境、真实本地 MCP 协议传输以及明确的权限校验。第一版保留了 45 次合成实验;第二版继续增加 30 次完整实际回报的对照实验,以及基于 1,930 个公开 BFCL 任务的 15 次实验,并在同一组 200 个留出任务上运行两种本地小模型。代码、实验协议、表格和校验脚本一起公开,便于他人复现和质疑。

最值得写下的结果:更强的基线改变了结论

早期结果看起来有利于双重稳健估计(DR)。但加入预测完整实际回报的直接回归基线后,线性设定下的离线评估平均绝对误差变成直接回归 0.0139、DR 0.0272;在分布偏移下则是 DR 0.0227、直接回归 0.0948。结论不是“某个方法全面胜出”,而是不同条件下谁占优必须经由对照实验确认。我们保留第一版的数据,没有悄悄覆盖不利于原叙事的结果。

公开数据、弃权和缺失支持

在按函数名分组隔离的 BFCL 派生测试中,直接选择器的平衡准确率为 81.85%,DR 为 79.83%,TF-IDF 为 69.23%。发现候选数量可能构成捷径后,我们补报多候选子集的诊断:直接选择器 76.80%,TF-IDF 64.89%。两种实际运行的本地 Qwen2.5 小模型,在固定提示下对 128 个应当弃权的样本均未正确弃权;这不能外推到所有大模型。另一个结果涉及缺失历史支持:如果新旧策略在无支持动作上完全相同,它们的相对差值仍可能可识别。保留分歧的回退方案在五次支持缺口运行中都满足结构可识别,但保守区间没有证明可以自动上线改进。

公开后的状态与边界

论文《Counterfactual Tool Ranking under Utility, Cost, and Privilege Constraints》已在 arXiv 公开,目前是未经同行评审的工作论文。它研究单次固定候选的工具选择,并不宣称解决多步 Agent、官方 BFCL 排名或生产环境的安全保证。对我来说,这次最有价值的经验是:用 AI 尽快把研究想法变成清晰、可执行、可证伪的计划,再用更强的基线和公开证据纠正自己。

论文:https://arxiv.org/abs/2609.22819
代码与实验材料:https://github.com/jaxblack/counterfactual-tool-ranking

最后更新于 2026年9月22日 by qlili

0 0 votes
Article Rating
guest

0 Comments
Newest
Oldest Most Voted
0
Would love your thoughts, please comment.x
()
x