post · 2026.09.27

用数据做产品迭代:什么时候加能力,什么时候该收手

系统#AI Code Review#研发效能#质量测试#产品设计

“更智能"很诱人,但它值不值得上,得让数据说话——而不是让"感觉更先进"说了算。


开场:换了个"更高级"的锅,却把饭烧糊了

你家炒菜,邻居推荐你换一口"超高级不粘锅”。你换了,菜炒出来却糊了。

为什么?因为锅好不好用,不只看"高级不高级",而要看在你这套场景、这种做法下,它是不是真的更好。高级≠适合,更不等于"变好"。

AI 审查的产品迭代,同样的陷阱每天都在发生:看到一个"更先进的工具/能力",就想加进去给产品升级——但加上之后,产品真的变好了吗?


二、常见的"加了更高级,反而变差"的场面

给 AI 审查加"更高级"的东西,很多是出于直觉,但直觉常骗人。举几个真实会踩的坑:

坑 1:加了个"更聪明的搜索",误报却暴增 给 AI 加一个能"更深挖代码"的能力。结果它抓到的真问题确实多了,但乱报的问题更多了——团队被一堆假警报淹没,反而没人看 AI 说什么了。

坑 2:加了个"高级能力",审查却变慢变贵了 新能力让每次审查多花几倍时间/资源,但正确率几乎没涨。除非你的场景真的需要那点精度,否则性价比存疑。

坑 3:以为"更强的模型"就一定更好 换个"更高级的模型",不代表审查更准。真实评测里可能发现:贵的那款,正确率反而不如便宜的那款——“贵"和"适合"是两回事。

坑 4:同一个能力,对甲是宝藏,对乙是毒药 前面提到过:同一个新工具,配在这个"AI 型号"上变好了,配在另一个"型号"上却误报大增。工具的收益不是绝对的,它像"性格放大器”——会放大你所用的底层模型/场景的长处和短处。


三、那怎么决策?——让"同一套评测"来当裁判

既然"感觉"和"直觉"都不可靠,那就用我们在整个系列里建的武器:同一套可信的评测,来给"要不要加这个能力"做裁决。

具体流程:

① 想加某个新能力/新工具
② 不改变其他任何东西,只加这一个(对照实验,见第 8 篇)
③ 在同一张考卷、同一套评分规则下,跑两个版本
④ 看完整指标:该抓的抓到了没(P/R)?误报多没多?开销变没变?
⑤ 结论由数据下,不由"更先进"的感觉下

关键:加能力,要像"做实验"一样对待,而不是像"装软件"一样顺手就装。 每一次产品能力改动,都是一次可衡量的小实验。


四、好用的一套"体检指标"(迭代专用)

产品迭代时,不要只看一两个数,要看一套"体检表"。举例:

  • 召回率 R:真问题抓到的比例——该抓的漏没漏;
  • 精确率 P:报出来的准不准——乱报多不多;
  • 误报数(FP 单列):专门盯"瞎报",因为它是信任杀手;
  • 开销/时长:每次审查花多少资源、多久——墙钟时间、成本;
  • 分场景表现:在"简单/难/干净/有风险"的不同题上分别如何——别被平均值骗了。

一个很实用的告诫:别被"某个指标创新高"冲昏头。比如"召回率大涨"很爽,但要立刻看旁边的"误报涨没涨"——很多时候"抓到更多"是用"乱报更多"换来的,净效果并不好。


五、什么时候"该加",什么时候"该收手"

该加的情况:

  • 加了之后,该抓的变多、乱报没变多、开销可接受;
  • 而且这种改善,在多个场景/型号上都方向一致(不是只有某个特例好)。

该收手的情况:

  • 加了之后,乱报明显变多(即使召回率涨了);
  • 开销涨幅远超收益;
  • 只在一个极端场景好、别处没变化甚至变差;
  • “更高级"却测不出实质进步。

记住那句金句(本系列最想让你记住的一句):

工具/能力能不能上,由"同口径的对照实验"说了算,不由"它听起来多先进"说了算。


深入一点(可跳读)

  • 迭代里最容易自欺的一句话是"这次升级肯定更好”。要专门防它:升级前先想好"如果它其实没变好,我能不能接受这个结果"。能接受失败,实验才是诚实实验。
  • 有一个好习惯:每个候选新能力,都先写一页"预期收益与风险",跑完对照实验后回来对一下——预测得准不准,本身也在训练团队的判断力。
  • 版本号记账在这里再次重要:每次"加/换能力"都留版本,这样"这个数字是加了这个能力的那个版本跑出来的",永远说得清——迭代再多也不乱。

这一篇的收获

迭代产品时,别被"更高级"“更智能"诱惑。任何新能力的生死,都由同一套可信评测的对照实验裁决:该抓的抓对没、乱报多没多、开销合算没、多个场景方向一致没。该收手就收手——很多时候不加,比乱加更好。

到这里,单人视角的产品设计、质量、上线、迭代都齐了。但产品是团队用的,真正要让 AI 审查发挥研发效能,得让团队一起用好这套方法。下一篇讲落地与文化建设。