为使用 SVN 的大型遗留代码库做自动审查时,我把质量分析、代码图谱、语义检索和运行时查证接进流水线。除了生成建议,还需要知道建议是否有依据、用户是否采用,以及一次审查花了多少时间和 token。
成本比较需要一个质量前提
内部对照评测中,在保持查证率的条件下,流水线的 token 消耗约为对照 Agent 方案的六分之一,执行时间约为十分之一。
这里的前提与结果同样重要。如果只比较消耗和耗时,就无法判断节省是否来自少做了必要的查证。这个结论限于内部评测,不能据此推断所有代码库、所有任务都会得到相同收益。
采纳和正确反馈不是一回事
常态运营后,系统平均每晚处理 5 千多次请求,用户采纳率约 9%。已收到的反馈中,正确反馈占比约 76%,计算方式是“正确反馈数/反馈总数”。
9% 描述用户的采用行为,76% 描述已收到的反馈。没有反馈的请求不在后一个分母里,因此不能把它当作全部审查请求的正确率。这也是我开发反馈分析页面、收集操作与评论的原因:汇总值之外,还需要看到具体意见。
让指标服务于下一次修改
我希望评测能帮助回答一个具体问题:下一步应该改哪里?查证不足时,检查依据如何取得;建议未被采用时,结合评论理解原因;耗时上升时,再沿请求链路排查。
把这些问题分开,才能讨论质量、时间与成本之间的取舍。一个看上去不错的数字,本身还不是结论。