科学研究基准 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 科学研究基准 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 创意重建 1 Reconstruction:从发表前参考文献盲重建研究创意 08-18 历史回测 1 科学问题发现的历史回测协议与天文学试点 08-18 发现能力评测 1 Apodex Discovery:面向真实发现任务的AI评测环境 08-18 工作流评测 1 FrontierChallenge:科学工作流完成度评测 08-28 形式化评测 1 FormalTCS:端到端前沿理论计算机科研评测 08-21 灾害评测 1 EarthVerse:动态地球系统与自然灾害科学智能体基准 08-25 科学编程 1 SWE-bench Science:科学软件工程中的编码智能体评测 08-21 科研评测 3 SCILAWS-BENCH:评测 LLM 在真实与平行世界中发现科学定律 09-02 ScienceArena:最新科学奥赛大模型评测基准 09-01 ASI-Bench:评测 AI 自主科研与创新探索能力 08-20 科研评测基准 1 DeltaML-Bench:真实科研仓库中的机器学习智能体评测 08-21 算法设计 1 AI4AI-Bench:评测 LLM 智能体的递归自改进算法设计能力 08-21 自动化科研 1 最大规模AI自主科研测试:Fable 5断层领先 08-17 计算评测 1 AtmosCoder-Bench:执行验证揭示环境科学计算中的隐性失败 08-20 语言推理 1 IOL-AI Challenge:以语言学奥赛推进语言推理评测 08-19 过程评测 1 超越最终得分:长程 AI 研发智能体的系统评估 08-16