数据工程 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 数据工程 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) AI辅助编程 1 昆仑万维发布软件工程智能体模型 Skywork-SWE-32B 06-20 下游任务适配 1 为下游任务优化语言模型:训练后视角 06-27 中期训练 2 首创 Mid-training 范式破解 RL 奥秘,Llama 推理性能追平 Qwen 07-01 OctoThinker:中期训练促进强化学习规模化 06-25 临床评测 1 LLM作为模糊评判:微调大模型用于临床评估 06-16 主动学习 1 ATGen:面向自然语言生成的主动文本生成框架 07-01 主动推理 1 从被动推理到主动推理:大型语言模型能否在不完整信息下提出正确问题? 06-12 事实一致性 1 AssertBench:评估大型语言模型自我断言能力的基准 06-16 人工智能工业应用 1 航空发动机大模型解决复杂时序问题,性能超越 GPT-4o 06-30 代码数据 1 CodeGraph 数据集 12-31 代码模型 1 CodeFuse-CGM:面向代码智能的开源代码图模型 06-28 代码评测 4 OJBench:面向大语言模型的竞赛级代码评测基准 06-24 微软发布 SWE-bench-Live:Agent 全自动搭建代码环境并实时更新评测 06-20 LiveCodeBench Pro:奥赛级竞技编程基准揭示顶尖 LLM 的推理短板 06-19 人类最后的代码考试:高级大模型能否攻克最难编程竞赛? 06-18 任务生成 1 AgentSynth:面向通用计算机使用智能体的可扩展任务生成 06-19 低资源机器翻译 1 TranslatePsy-AfriSLM:面向非洲低资源机器翻译的高质量数据扩展 08-20 信息检索 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-27 偏好优化 1 使用规则引导的合成数据进行可配置偏好调优 06-16 元学习 1 使用元学习检测维基百科傀儡账号 06-13 公平性评测 1 LiveBench:具有挑战性且无污染的大语言模型基准 07-17 创意写作 1 LitBench:可靠评估创意写作的基准与数据集 07-02 动机推理 1 MotiveBench:大型语言模型距离类人动机推理还有多远? 06-18 医疗AI评测 2 MedXpertQA:专家级医学知识与高级推理评估基准 12-31 VQA-RAD医学视觉问答测试集 12-31 协作合成 1 GRA:多角色小模型协作生成媲美大模型的高质量训练数据 06-18 反例推理 1 ICML 2025:首个反例驱动推理基准揭示大模型“刷题式假象” 10-23 可信推理 1 ReliableMath:评估大模型数学推理可靠性的开源基准 07-17 因果推理 2 揭示大型语言模型中的因果推理:现实还是海市蜃楼? 06-27 CLEAR-3K:评估语言模型的因果解释能力 06-24 图像评测 1 MMMG:面向文本到图像推理的大规模多学科多层级生成基准 06-13 图形用户界面纠错 1 GUI-Critic-R1:为GUI智能体操作加上“紧急刹车” 06-18 多模态学习 1 面向指代表达分割与视觉定位的低成本主动学习 09-01 多模态推理 1 GRPO-CARE:面向多模态推理的一致性感知强化学习 06-24 奖励建模 1 Skywork-Reward-V2:通过人机协同扩展高质量偏好数据管理 07-02 开发评测 1 SWE-Dev:评估与训练自主特性驱动软件开发系统 05-16 开放式推理 1 PuzzleWorld:面向益智寻谜的多模态开放式推理基准 06-10 形式化证明 2 通过一阶逻辑定理证明提升大模型数学推理能力 06-24 MATP-BENCH:多模态大模型自动定理证明正确率仅约4% 06-18 形式化验证 1 可验证自然语言到线性时间逻辑的转换:VLTL-Bench 基准与评估套件 07-01 指令数据合成 2 腾讯优图提出 RAIF 激励推理方法,复杂指令性能提升 11.74% 06-24 Infinity Instruct:扩展指令选择与合成以增强语言模型 06-16 推理蒸馏 1 NaturalThoughts:为通用推理任务选择和提炼推理轨迹 07-03 推理评测 6 OneEval:面向多元化知识库的LLM知识密集型推理基准 12-31 FormulaOne:图结构动态规划评估集 12-31 ICML 2025 新基准揭示 LLM 推理短板:高分或源于符号记忆 10-23 MMReason:面向 AGI 的开放式多模态多步骤推理基准 07-01 RE-IMAGINE:用于推理评估的符号化基准合成 06-23 IneqMath:29个大模型奥数级不等式证明成功率不足50% 06-20 提示审计 1 斯坦福、MIT 等发布最大系统提示词库与 AISPA 审计框架 08-15 操作学习 1 BridgeVLA:基于2D热图的高效3D机器人操作学习模型 06-27 数学推理 1 AceReason-Nemotron 1.1:通过 SFT 与 RL 协同提升数学和代码推理 06-18 数学数据 1 DeepMath-103K:用 10.3 万道高难数学题突破大模型推理瓶颈 06-12 数据合成 4 DataFoundry:递归自改进的数据生产流程 09-02 唐杰披露智谱大模型训练数据与后训练布局 09-01 水印与掩蔽递归离散分布估计的极小极大界 09-01 REER-PT:以困惑度引导逆向推理增强预训练数据 09-01 数据开放 1 EgoSuite-Open100K:10万小时人类行为数据开源 08-25 数据归因 1 语言模型预训练中的任务无关数据影响度量 08-16 数据效能 1 语言模型训练的数据效能:DELT 数据组织范式 06-27 数据泄露 1 真相大白!RL不是魔法,随机奖励有效只是由于数据泄露 07-18 数据混合 3 工业级 LLM 后训练:面向棕地维护的 Dataware 工程 09-01 AutoMixer:利用训练检查点自动优化数据混合 06-30 Domain2Vec:向量化数据集,无需训练寻找最优数据混合 06-13 数据策展 1 蚂蚁OmniTable统一宽表管理35PB大模型训练数据 09-02 数据获取 1 清华刘知远团队:高质量 LLM 训练数据获取 06-13 数据规模扩展 1 Skywork-SWE:揭示大模型软件工程能力的数据缩放定律 06-25 数据质量 1 评估数据质量在训练双语语言模型中的作用 06-18 数据集构建 1 Skywork-SWE:SWE-Dev 可验证软件开发数据集构建流程 08-06 文本增强 1 PromptAug:使用数据增强进行精细冲突分类 07-01 文档转换 1 EasyDoc:将文档转换为 AI 友好格式的实用工具 06-27 智能体训练 1 上交大新范式:78条高质量样本胜过万条数据 09-28 智能体记忆 1 Memory+Agent:人大高瓴与华为诺亚构建大模型智能体记忆研究体系 08-08 智能体评测 3 DeepResearch Bench:深度研究智能体综合评测基准 06-16 测量数据科学自动化:AI 助手与智能体评估工具综述 06-12 EconWebArena:现实 Web 环境中的经济任务自治智能体评测基准 06-12 检索智能体 1 阿里发布信息检索智能体 WebDancer,GAIA 基准超越 GPT-4o 06-28 模型发布 1 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 模型安全 1 思想犯罪:推理模型中的后门与涌现失调 06-18 模型训练 1 面向噪声 LLM 标注的错误类型感知 NER 损失重加权 09-01 模型验证 1 CompassVerifier:跨领域验证 LLM 输出的轻量级模型 12-31 深度研究智能体 2 MiroMind ODR:开放深度研究全流程项目 12-31 WebWatcher:面向高难度多模态深度研究的智能体方案 12-31 用户表征 1 十亿级用户表示学习的行为致密化定律 08-26 监督学习 1 生成式视角重塑监督学习:预测一致性学习让标签成为学习指南 06-25 科学发现 1 DrSR:基于数据与经验双重推理的科学方程发现框架 06-23 科学推理 1 史上最大高质量科学推理后训练数据集开源,快速让 Qwen3 等变“科学家” 12-31 科学数据 2 上海创智学院与上海交通大学发布科学推理数据集 MegaScience 12-31 AutoSDT:面向开放科学智能体的数据驱动发现任务合成管道 06-12 科学检索增强生成 1 ScIRGen:为科学研究合成真实的大规模 RAG 数据集 06-16 科研应用 1 AI4Research:人工智能赋能科学研究综述 07-02 科研评测 1 SciArena:面向科学文献任务的开放式基础模型评估平台 07-02 程序修复 1 北大、字节跳动等发布 SWE-Swiss:面向代码修复的开源训练方案 12-31 答案验证 1 CompassVerifier:面向多领域答案评估与奖励的轻量级验证模型 12-31 结构引导 1 设计合成:通过结构引导控制数据生成 06-11 统一多模态建模 1 OpenUni:1.1B 参数统一多模态模型媲美 BLIP3-o-8B 06-23 统一框架 1 多模态统一框架的设计与规模化训练挑战 12-31 自进化框架 1 HarnessBank:面向 Agent-Harness 自进化的语义基因库 08-11 规划评测 1 看似简单的规划问题也具计算挑战:倒计时游戏基准 08-04 规模扩展瓶颈 1 Orion性能未达预期,三大瓶颈制约模型扩展 12-31 视觉推理 2 CaughtCheating:多模态大模型能否成为优秀的作弊侦探? 06-23 SynthRL:通过可验证的数据合成扩展视觉推理 06-03 视频到音频生成 1 Kling-Foley:为视频生成音画同步的高质量立体声 06-28 视频数据 2 多机构联合推出持续迭代的视频数据集项目 Sekai 12-31 浙大开源UltraVideo超高清视频数据集,推动原生4K视频生成 07-02 视频生成 1 DreamX-Creator:普惠化原生 2K 音视频联合生成 09-02 训练范式 1 ORBIT:时间序列基础模型的可控训练范式 08-16 记忆能力评测 1 MemBench:全面评估基于 LLM 的智能体记忆能力 06-30 论文写作 1 1947篇AI顶会论文揭示高质量论文写作法则 08-14 证明语料库 1 开放证明语料库:大规模研究 LLM 生成的数学证明 06-30 评分偏差 1 评估 LLM-as-a-Judge 中的评分偏差 06-30 评测可靠性 1 使用开放基准测试评估语言模型的陷阱 07-01 评测基准 1 AI 基准测试:从专业难题到大众谜题,探索 AI 推理能力 10-23 评测审计 1 垃圾输入,推理输出?为何基准分数不可靠及如何应对 07-01 负向微调 1 NFT:利用隐式负向策略提升数学推理能力 06-23 轻量化模型 1 DFM Mimir v1:仅用许可数据训练的 1B HRM 模型 08-17 过程奖励模型 1 SPARE:基于参考引导评估的单次过程标注框架 06-23 运动跟踪 1 HumanTracker:人类感知对齐的人形运动追踪基准 08-18 逻辑评测 1 SATQuest:用于逻辑推理评估与微调的验证器 12-31 题目生成 1 通过联合叙事与难度控制推进问题生成 06-11 验证器模型 1 CompassVerifier:3B验证模型与多领域高难度基准 VerifierBench 12-31