昊梵体育网

AI coding agents几乎不会正确使用任何测试或验证技术,所有复杂方法都被它们用得很差。 默认模式(不给任何测试指示)反而表现最好,因为不会让 agent 做大量无效工作。 形式化方法(Lean、TLA+、Verus 等)基本无效,agent只会证明无关紧要的性质。 TDD、QuickCheck、pro ​

网页链接AI coding agents几乎不会正确使用任何测试或验证技术,所有复杂方法都被它们用得很差。 默认模式(不给任何测试指示)反而表现最好,因为不会让 agent 做大量无效工作。 形式化方法(Lean、TLA+、Verus 等)基本无效,agent只会证明无关紧要的性质。 TDD、QuickCheck、property-based testing 等都被 agent表面化使用,无法发挥价值。 Fuzzing偶尔有效,但成功率极低(约 5/160),说明 agent“知道但不会用”。 大多数测试库和技能(Hegel、ECC、Trail of Bits)都让结果更差且更贵。 作者自己写的轻量 skill 效果最好,但也远未达到人类测试的水平。 总体结论:当前 AI agents 的最大瓶颈是测试能力极差,远不具备独立写可靠代码的能力。

--end--