BrowseComp测试基准归档

刚刚，OpenAI开源BrowseComp，重塑Agent浏览器评测

2025年4月11日8时作者 AIGC开放社区

今天凌晨2点，OpenAI开源了专门用于智能体浏览器功能的测试基准——BrowseComp。这个测试基准非常有难度，OpenAI自己的模型准确率只有0.6%和0.9%，但最新发布的Agent模型Deep Research准确率达到51.5%，展示了其在自主搜索、信息整合和准确性校准方面的优秀能力。