o1-high归档 - 每时AI

OpenAI官方基准测试：承认Claude遥遥领先（狗头）

上午11时 2025/04/03 作者量子位

OpenAI发布PaperBench新基准测试，最新版Claude-3.5-Sonnet在复现ICML2024论文任务中超越其他顶尖大模型。对比去年的MLE-Benchmark，PaperBench更侧重综合能力评估。