ICLR 2025|AI不语,只是一味根据人类意图推理3D空间定位

AIxiv专栏发布了一篇关于3D意图定位的研究文章,该技术能够根据用户的意图在3D场景中检测目标物体,而非仅依赖于明确的物体描述。通过引入GPT-4生成意图文本,并采用多模态融合和自适应学习方法,实现了优于现有模型的效果。

ICLR 2025|浙大、千问发布预训练数据管理器DataMan,53页细节满满

AIxiv专栏探讨了DataMan数据管理器在优化大语言模型预训练中的应用。该研究提出了一个全面的质量评分体系,用于15个常见应用领域的预训练数据质量评估和领域识别,显著提升了模型性能。

谷歌发布BIG-Bench超难基准:DeepSeek-R1得分6.8,只有o3-mini超过10分

近日,谷歌发布了一项高难度基准BIG-Bench Extra Hard(BBEH),旨在评估AI模型的高阶推理能力。该基准包含了23个任务,并将每个任务替换为更难的任务,覆盖更多方面的技能需求。如o3-mini (high)得分为44.8分不及格,而其它模型得分不超过10分。