数据合成 LLM-DailyDigest 2025-10-20 2025-10-20 约 100 字 预计阅读 0 分钟 相关消息(按子主题自动聚合) 世界模型 1 Code-as-World:智能体发现可执行世界表示以增强物理推理 09-01 两阶段蒸馏 1 GEAR:表格基础模型的生成扩增与真实锚定两阶段蒸馏 08-20 交互控制 1 OS-Kairos:以置信度机制避免 GUI 智能体“过度执行” 07-03 任务生成 4 FACET:保留源意图与可执行状态的终端任务合成框架 08-20 从 CNF 实例生成多样化可满足性逻辑推理问题 12-31 AgentSynth:面向通用计算机使用智能体的可扩展任务生成 06-19 TaskCraft:自动生成代理式任务与执行轨迹 06-13 低资源学习 1 面向低资源大模型任务的可迁移提示与对齐策略 07-01 低资源机器翻译 1 TranslatePsy-AfriSLM:面向非洲低资源机器翻译的高质量数据扩展 08-20 体裁扩展 1 属性引导的多体裁创意写作数据扩展 08-21 偏好优化 1 使用规则引导的合成数据进行可配置偏好调优 06-16 元认知 2 评估与改进大语言模型的自我建模能力 09-01 MERA:分离推理与控制的元认知推理框架 12-31 入侵检测 1 Diff-DDoS:面向5G信息物理系统的扩散攻击合成与鲁棒检测 08-19 动态增强 1 LSADA:学习状态感知的动态生成式数据增强 08-20 医疗健康数据 1 用表格扩散 Transformer 生成基准健康数据 08-17 协作合成 1 GRA:多角色小模型协作生成媲美大模型的高质量训练数据 06-18 协同演化 1 清华 CPMöbius:Coach-Player 协作共演化实现自主出题训练 08-12 原型推理 1 ProtoReasoning:以推理原型提升大模型跨领域泛化能力 06-23 反思回溯 1 ASTRO:通过上下文反思与回溯训练语言模型推理 07-01 可扩展推理 1 SLR:可扩展逻辑推理的自动化综合框架 06-23 合成强化 2 Synthetic Data RL:仅靠任务定义合成数据并强化学习 06-25 合成数据强化学习:任务定义即你所需 05-23 合成数据训练 1 Synthetic Data RL:仅凭任务定义生成数据并强化学习 12-31 多模态推理 1 CoRGI:以视觉证据验证思维链的多模态推理框架 08-05 奖励机制 1 强化学习奖励机制现状:验证、粒度与训练策略 12-31 奖励蒸馏 1 AdvDistill:通过奖励引导的数据集蒸馏增强小语言模型推理能力 07-02 工具使用训练 2 MidTool:面向智能体工具使用的中期训练数据合成 08-21 Palmyra x6:基于锚定监督微调的企业级工具调用模型 08-18 工具调用 2 多工具智能体的全自动推理轨迹生成与训练 12-31 DICE-BENCH:多轮多方对话中的大模型工具使用评估 06-28 工程进化 1 腾讯混元两项工作:Harness Handbook 与 RST 递归任务合成 08-20 序列推荐 1 RecPFN:面向上下文序列推荐的先验拟合网络 08-22 弱点合成 1 SwS:LLM 推理强化学习中的自我感知弱点驱动问题合成 06-12 形式化证明 1 Goedel-Prover-V2:通过分阶段数据合成与自我纠正扩展形式定理证明 08-05 意图拒绝 1 WIFA:基于意图组监督的 LLM 安全拒绝训练 08-16 批评微调 1 通过单问题批评微调释放预训练大模型的推理潜力 06-09 技能演化 1 Socratic-SWE:基于轨迹技能的自进化编程智能体 08-14 技能自博弈 1 阿里 Skill-SP:以自进化技能库实现高质量自博弈 08-12 指令数据合成 2 腾讯优图提出 RAIF 激励推理方法,复杂指令性能提升 11.74% 06-24 Infinity Instruct:扩展指令选择与合成以增强语言模型 06-16 推理评测 1 RE-IMAGINE:用于推理评估的符号化基准合成 06-23 提示合成 2 PromptCoT 2.0:面向大语言模型推理的可扩展提示合成 12-31 PromptCoT 2.0:以 EM 循环合成高难度推理任务 12-31 数学合成 1 MathFusion:融合数学问题,45K 合成数据带来 18% 能力提升 06-18 数学数据 1 DeepMath-103K:用 10.3 万道高难数学题突破大模型推理瓶颈 06-12 数据合成 13 DataFoundry:递归自改进的数据生产流程 09-02 唐杰披露智谱大模型训练数据与后训练布局 09-01 水印与掩蔽递归离散分布估计的极小极大界 09-01 以训练分布归纳偏置学习可接受 PDE 假设的几何结构 09-01 RailGen:智能体引导的铁路小型异物生成与检测 09-01 合成数据隐患:无害文本中的隐蔽定向偏见注入 09-01 RailSyn:面向铁路异物检测的诊断引导图像生成 09-01 什么是优质智能体数据?基于 ACE 视角的数据生成框架 08-28 AlphaGeometry:用合成数据学习几何辅助线生成 12-31 SWE-Flow:以测试驱动方式合成软件工程数据 12-31 仅用约100道种子题,Socratic-Zero合成数据质量超GPT-5 09-23 Code2Logic:游戏代码驱动的多模态推理数据合成 09-23 SWE-Flow:以测试驱动方式合成软件工程数据 06-09 数据策展 1 基于失败模式上下文赌博机的对抗数据策展 08-20 数据自演化 1 BigBang-V1:35B 模型用自演化合成数据挑战万亿参数模型 08-07 数据课程 1 面向通用图像生成的能力中心化数据设计 08-19 文本增强 1 PromptAug:使用数据增强进行精细冲突分类 07-01 时间序列预测 1 MetaCaster:多智能体驱动的轻量时序预测器少样本训练 08-25 智能体 1 SWE-Dev:通过训练与推理扩展构建软件工程智能体 06-07 智能体自进化 2 SEA:面向计算机使用的自我进化代理 08-06 UI-Genie:面向移动端 GUI 智能体的自改进框架 05-28 模型发布 1 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 模型训练 1 面向噪声 LLM 标注的错误类型感知 NER 损失重加权 09-01 测试生成 1 CodeContests+:为竞技编程生成高质量测试用例 06-10 游戏生成 1 ViGaL:以游戏化合成任务培养通用多模态推理能力 12-31 漏洞训练 1 CyberFactory:用真实漏洞实例扩展大模型网络安全能力 08-27 特质迁移 1 扩大量化生成蒸馏数据使教师潜在特质更易显现 08-29 环境合成 1 CogEvol:高效可靠的学习环境生成模型 09-02 界面移除 1 Game2World:清理游戏 UI 以扩展世界模型训练数据 08-27 科学推理 1 史上最大高质量科学推理后训练数据集开源,快速让 Qwen3 等变“科学家” 12-31 科学数据 2 上海创智学院与上海交通大学发布科学推理数据集 MegaScience 12-31 AutoSDT:面向开放科学智能体的数据驱动发现任务合成管道 06-12 科学检索增强生成 1 ScIRGen:为科学研究合成真实的大规模 RAG 数据集 06-16 科研智能体 1 PaperGym:以评分准则驱动科研计划生成与训练 09-01 程序修复 1 Anchored Self-Play:锚定自博弈提升代码修复真实性 08-14 红外目标检测 1 合成数据训练热红外无人机检测模型 08-19 结构引导 1 设计合成:通过结构引导控制数据生成 06-11 结构推理 1 通过结构化推理增强大语言模型 06-26 缺失前提识别 1 ACA-RL:面向缺失前提推理的询问、条件回答与弃答强化学习 08-18 网页数据合成 1 BrowserForge:并行浏览器沙箱扩展网页交互轨迹 08-26 自博弈 1 SSR:通过自博弈训练超智能软件智能体 08-14 自我学习 1 MIT SEAL:通过自生成数据与权重更新实现模型自我适应 12-31 自我训练 1 CMU 提出自我奖励训练 SRT:大模型能否实现无标签自训练? 05-27 自演化数据合成 1 VISA:面向多模态指令遵循的智能体自演化数据合成 08-27 自蒸馏 1 无监督同策略自蒸馏 U-OPSD 08-12 自进化 2 专访胡梦康:Agent 之后,下一站是 AI 自我进化 08-18 多数投票驱动的推理模型迭代式自我训练 02-03 自进化闭环 1 AI4AI:AI训练、优化与评测AI的新范式 08-20 自适应 1 自适应语言模型(SEAL) 06-12 自适应推理 1 推理混合:教大型语言模型使用自适应策略进行推理 07-01 表格基础模型 1 EXAONE Tabular 1.0:紧凑型表格基础模型 08-27 规则评测 1 RuleWeaver:评测大模型规则中心场景推理 08-29 视觉推理 2 SynthRL:以可验证数据合成扩展视觉推理 06-04 SynthRL:通过可验证的数据合成扩展视觉推理 06-03 解释评测 1 CHIVE:用反事实实验评估大模型行为解释 08-18 记忆能力评测 1 MemSim:用于评估大模型个人助理记忆能力的贝叶斯模拟器 09-30 论文轨迹 1 将科学论文展开为多轮生成轨迹以持续预训练 08-27 证明语料库 1 开放证明语料库:大规模研究 LLM 生成的数学证明 06-30 评分偏差 1 评估 LLM-as-a-Judge 中的评分偏差 06-30 评测基准构建 1 BTS-AgentBench:从只读遥测日志构建可复现智能体基准 08-28 语音增强 1 基于音素的 TTS 数据增强扩展与 ASR 受控研究 08-29 课程学习 1 百个种子问题驱动的多智能体课程生成 12-31 课程生成 1 Ornith-1.5自生成任务闭环提升编码智能体 08-27 资源图谱 1 LLM强化学习环境与开源训练框架资源图谱 12-31 转录组生成 1 知识引导的合成转录组数据生成方法 08-16 软件工程 1 SWE-Flow:以测试驱动方式合成软件工程数据 06-12 连续推理 1 SynAdapt:利用合成连续思维链实现高效自适应推理 08-05 遥感数据增强 1 合成数据增强用于乌克兰战损农田卫星分析 08-18 错误反思 1 LEMMA:用“错题本”反思学习提升大模型数学推理能力 06-19 顶级学术会议成果 1 小米 8 篇大模型与智能体论文入选 EMNLP 2026 08-29 预训练对齐 1 Synthetic Persona Pretraining:从首个 Token 开始对齐 08-16 题目生成 2 自动生成用于阅读理解评估的推理问题 06-12 通过联合叙事与难度控制推进问题生成 06-11