VeriHarness 拆解:多数投票为何会掩盖错误 - frankzch

Wait 5 sec.

【摘要】一个没有答案 key 的难题 智能体跑完一个几十步的长任务,交出一份表格、一份报告或改好的文件,谁来判定它对不对?短问答可以靠标准答案或单元测试,但长任务的交付物往往没法写成断言:一个财务比率可能取错了年份,一份报告可能引用了已失效的来源,而且这些错误通常藏在"看起来很正常"的成品里。 谷歌云 AI 阅读全文