Epoch AI 评审 ExploitBench v0.1:41 个真实 V8 漏洞的利用能力阶梯
Epoch AI 于 9 月 12 日发布对 ExploitBench v0.1 的基准评审,给出“已验证”结论。该基准由卡内基梅隆大学研究者创建,用 41 个 2024 年后公开披露的真实 V8 漏洞,按 5 层 16 项可验证能力阶梯为模型打分,最高到任意代码执行。评审同时指出污染风险、回合预算偏紧与“能力覆盖百分
Epoch AI 评审 ExploitBench v0.1:41 个真实 V8 漏洞的利用能力阶梯