2025-09-23 科研追新
当日精选(由提交工具自动创建)。
仅用约100道种子题,Socratic-Zero合成数据质量超GPT-5
阿里与上海交大提出Socratic-Zero框架,以约100道种子题生成高质量逻辑推理数据,据称数据质量超过GPT-5生成结果。
阿里与上海交通大学面向ICLR 2026提出Socratic-Zero框架,用少量种子题开展逻辑推理数据合成。该方法仅需约100道种子题,即可扩展生成用于模型训练的高质量数据。原文称其合成数据质量超过GPT-5生成的数据,显示出低资源数据构造的潜力。需要注意的是,消息发布者说明种子数量并未严格确定。
用途与启示
- 降低逻辑推理数据合成对大规模人工种子集的依赖
- 为低成本构建高质量训练数据提供新思路
- 启示研究者进一步验证种子规模、数据质量与模型收益之间的关系
📝 原始笔记(逐字保留)
20250923|ICLR2026|**[仅100种子题,合成数据质量超GPT-5,阿里、上交提出Socratic-Zero框架](https://mp.weixin.qq.com/s/2Og4idDwqshfvEx2urBL2g)** (我的种子数量并没有严格确定)
Code2Logic:游戏代码驱动的多模态推理数据合成
Code2Logic首次提出利用游戏代码合成多模态推理数据,覆盖30款游戏、158个任务和14万条问答对,以增强视觉语言模型的通用推理能力。
Code2Logic提出一种由游戏代码驱动的多模态推理数据合成方法。该项目从30款游戏中构建158个任务,共生成约14万条问答对。其核心目标是借助游戏环境中明确的规则与状态变化,为视觉语言模型提供可规模化、可验证的逻辑推理训练数据。
用途与启示
- 利用可执行游戏代码低成本生成大规模多模态推理数据
- 借助明确的游戏规则和状态转移提升数据的可验证性
- 为增强视觉语言模型的通用逻辑推理能力提供训练资源与方法参考
📝 原始笔记(逐字保留)
20250923|[Code2Logic: Game-Code-Driven Data Synthesis for Enhancing VLMs General Reasoning”首次提出:游戏代码驱动多模态推理数据合成!](https://github.com/tongjingqi/Code2Logic):30款游戏 / 158 个任务 / 14 万条问答对
姚期智领衔提出大模型“思维”框架,逻辑推理正确率达98%
姚期智领衔团队提出面向大模型逻辑推理的“思维”框架,据报道将相关任务正确率提升至98%。
姚期智领衔团队提出一种面向大模型逻辑推理的“思维”框架。该框架旨在增强模型处理复杂逻辑问题时的推理能力与答案可靠性。据报道,其在相关逻辑推理任务上的正确率达到98%,展现出较高的性能潜力。具体方法、实验设置及适用范围仍需结合原文或论文进一步确认。
用途与启示
- 为提升大模型复杂逻辑推理的准确性提供新的框架思路
- 可用于研究显式推理过程、推理稳定性与结果校验机制
- 98%的结果需结合评测数据集、基线和泛化实验审慎解读
📝 原始笔记(逐字保留)
20250923|[姚期智领衔提出大模型「思维」框架!逻辑推理正确率达98%](https://mp.weixin.qq.com/s/2g5PIjSj4ahcx1C4nibiHw)