顶尖论文归档

AI复现顶尖AI论文？OpenAI最新测评：Claude 3.5得分第一

下午4时 2025/04/03 作者 AI寒武纪

PaperBench测试了多款AI模型复现ICML 2024顶会论文的能力。结果显示，Claude 3.5 Sonnet表现最好，平均得分为21.0%。研究发现当前AI在长期规划、持续调试和策略执行方面存在问题。PaperBench为评估AI科研能力提供了量化标准，有助于加速科学发现并推动开放协作。

一	二	三	四	五	六	日
			1	2	3	4
5	6	7	8	9	10	11
12	13	14	15	16	17	18
19	20	21	22	23	24	25
26	27	28	29	30	31