2025-06-10 科研追新

当日精选(由提交工具自动创建)。

论文自动生成代码

介绍一种将论文内容自动转化为代码的工具或工作流,帮助研究者快速实现论文方法。

 智能体工具 人工智能辅助编程 人工智能应用 自动化部署

该内容介绍了论文自动生成代码的相关工具。其目标是将论文中的算法、模型或实验流程转化为可执行实现,降低论文复现门槛。原文发布于微信公众号,具体支持范围和生成效果需参考链接内容。

用途与启示
  • 加速论文算法的原型实现与实验验证
  • 降低研究成果复现和工程落地的成本
  • 可用于评估自动生成代码的正确性、完整性与可运行性
📝 原始笔记(逐字保留)
6. 🌈 2025-06-10 20:38:33 Tuesday | 论文自动生成代码:https://mp.weixin.qq.com/s/g6SEOR3BrZTeNV41ZToxIQ ### AI浏览器

CodeContests+:为竞技编程生成高质量测试用例

CodeContests+利用基于LLM的智能体为竞技编程题目合成高质量测试用例,从而提升代码评估准确性与强化学习训练效果。

 数据合成 人工智能辅助编程 智能体 模型评估 强化学习

竞技编程具备较高的推理难度和精确的正确性反馈,但公开题库通常缺少足够的测试用例。研究者构建了基于LLM的智能体系统,为CodeContests中的题目自动生成高质量测试用例,并形成改进版数据集CodeContests+。基于172万个带通过或失败标签的提交进行验证后,CodeContests+展现出更高的评估准确率,尤其提高了真阳性率。进一步实验表明,更可靠的测试用例也能显著改善LLM代码强化学习的训练效果。

用途与启示
  • 为缺少测试数据的竞技编程题目自动扩充高质量测试用例。
  • 提高代码解答判定的准确性,减少因测试覆盖不足造成的误判。
  • 为代码模型的强化学习提供更可靠的奖励信号和可验证反馈。
  • 启示数据合成系统应结合历史提交与通过/失败标签,对生成测试的缺陷检测能力进行实证评估。
📝 原始笔记(逐字保留)
2. 2025-06-10 10:53:20 Tuesday | CodeContests+: High-Quality Test Case Generation for Competitive Programming 1. **标题** : CodeContests+:为竞争性编程生成高质量测试用例 2. **链接** :https://arxiv.org/abs/2506.05817 3. **摘要** :竞争编程由于其高推理难度和精确的正确性反馈,已成为训练和评估大型语言模型(LLM)推理能力的关键任务。然而,虽然有大量的公共问题数据,如问题陈述和解决方案,但这些问题的**测试用例**往往很难获得。因此,测试用例生成是构建大规模数据集的必要任务,测试用例的质量直接决定了评估的准确性。在本文中,我们介绍了一个基于LLM的代理系统,为竞争性编程问题创建高质量的测试用例。我们将该系统应用于CodeContests数据集,并提出了一个新的版本,改进的测试用例,命名为CodeContests+。我们 **评估了CodeContestsPlus中测试用例的质量** 。首先,我们使用了172万个带有通过/失败标签的提交来检查这些测试用例在评估中的准确性。结果表明,CodeContests+比CodeContests实现了更高的准确性,特别是具有更高的真阳性率(TPR)。随后,我们在LLM强化学习(RL)中的实验进一步证实了测试用例质量的提高为RL带来了相当大的优势。

苹果公布全产品线 AI 融合计划

苹果展示将人工智能融入全产品线的计划,涵盖通话实时翻译、AI 识物与智能搜索等能力。

 人工智能 人工智能应用 多模态

苹果公布了在其产品生态中全面融入人工智能的计划。相关能力包括通话实时翻译、基于 AI 的物体识别和智能搜索等。此举表明苹果正推动 AI 从独立功能转向操作系统与多设备体验的深层整合。

用途与启示
  • 关注端侧 AI 在翻译、视觉识别和搜索等高频场景中的落地。
  • 为研究跨设备 AI 能力集成与生态协同提供产业参考。
  • 观察隐私保护、端云协作及系统级智能体验的发展趋势。
📝 原始笔记(逐字保留)
7. 2025-06-10 10:13:38 Tuesday | 苹果展示了把人工智能融入其所有产品的计划,提供从通话实时翻译到 AI 识物、智能搜索等一系列能力。https://mp.weixin.qq.com/s/E5O6BuHny7vVY2hP0y3IIg

PuzzleWorld:面向益智寻谜的多模态开放式推理基准

PuzzleWorld收录667道益智寻谜式问题及详细推理轨迹,用于评估模型在问题结构不明确的多模态开放式推理任务中的能力。

 逻辑推理 多模态 推理 模型评估 数据工程 模型训练

PuzzleWorld包含667道复杂、多步骤的益智寻谜问题,每道题均标注最终答案、详细推理轨迹和认知技能标签。该基准要求模型从多模态证据中自行发现潜在问题结构,并通过迭代完成开放式、创造性推理。实验中,多数先进模型的最终答案准确率仅为1%至2%,最佳模型也只能解决14%的谜题,逐步推理准确率约为40%。利用推理轨迹微调可将逐步推理表现从4%提升至11%,而仅训练最终答案会使性能降至接近零。错误分析显示,现有模型普遍存在短视推理、语言推理受限以及视觉空间与草图推理能力不足等问题。

用途与启示
  • 评估模型在缺少明确任务定义时发现问题结构并持续推理的能力。
  • 支持对视觉空间推理、语言推理及不同认知技能进行细粒度诊断。
  • 说明过程级推理轨迹比单独监督最终答案更适合训练开放式推理模型。
  • 为科学发现、探索性数据分析和调查式问题求解等现实场景提供研究参考。
📝 原始笔记(逐字保留)
5. 2025-06-10 10:55:11 Tuesday | PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts 1. **标题** : PuzzleWorld:益智游戏中多模式、开放式推理的基准 2. **链接** :https://arxiv.org/abs/2506.06211 3. **摘要** :Puzzlehunts是一种复杂的,多步骤的谜题,缺乏明确的问题定义。与由具有明确指令的任务组成的传统推理基准相比,puzzlehunts需要模型从多模态证据和迭代推理中发现潜在的问题结构,反映现实世界的领域,如科学发现,探索性数据分析或调查性问题解决。尽管基金会模型最近取得了进展,但它们在这种开放式环境中的表现在很大程度上仍未得到检验。在本文中,我们介绍了PuzzleWorld,一个大规模的基准**667拼图狩猎式**的问题,旨在评估一步一步的,开放式的,创造性的多模态推理。每个谜题都标注了最终解决方案、详细的推理轨迹和认知技能标签,从而实现整体基准测试和细粒度诊断分析。大多数最先进的模型只能达到1-2%的最终答案准确率,最好的模型只能解决14%的难题,逐步准确率达到40%。为了证明我们的推理注释的价值,我们表明,对推理轨迹进行微调可以将逐步推理从4%提高到11%,而仅对最终答案进行训练则会将性能降低到接近零。我们的错误分析表明,目前的模型表现出近视推理,基于语言的推理的局限性,缺乏草图的视觉和空间推理的关键能力。我们在https://github.com/MIT-MI/PuzzleWorld上发布PuzzleWorld,以支持未来构建更通用,开放和创造性推理系统的工作。

数学推理大型语言模型研究综述

该综述从数学理解与答案生成两个认知阶段梳理大型语言模型数学推理的发展、增强方法、现实挑战及未来研究方向。

 推理 逻辑推理 模型训练 强化学习 模型评估

本文将大型语言模型的数学推理过程划分为“理解”和“答案生成”两个阶段,前者关注通过不同预训练策略获得数学知识,后者涵盖直接预测与逐步思维链推理。综述系统总结了无需训练的提示方法、监督微调、强化学习等数学推理增强技术,并讨论了长思维链和测试时扩展的最新进展。作者指出,当前方法在推理能力、计算效率和技术普及性方面仍存在根本挑战。未来可重点探索先进预训练与知识增强、形式化推理框架,以及基于原则化学习范式的元泛化能力。

用途与启示
  • 为研究者提供大型语言模型数学推理方法的系统分类与发展脉络
  • 帮助比较提示、监督微调、强化学习和测试时扩展等技术路线
  • 为形式化推理、知识增强和元泛化等后续研究提供方向
  • 为将数学推理技术迁移到其他复杂推理任务提供参考
📝 原始笔记(逐字保留)
**标题** : 数学推理大型语言模型研究 **链接** :https://arxiv.org/abs/2506.08446 **作者** : Peng-Yuan Wang, Tian-Shuo Liu, Chenyang Wang, Yi-Di Wang, Shu Yan, Cheng-Xing Jia, Xu-Hui Liu, Xin-Wei Chen, Jia-Cheng Xu, Ziniu Li, Yang Yu **摘要** :长期以来,数学推理一直是人工智能研究中最基本、最具挑战性的前沿领域之一。近年来,大型语言模型(LLM)在这一领域取得了重大进展。这项调查通过两个高级认知阶段来考察LLM数学推理能力的发展: **理解** ,模型通过不同的预训练策略获得数学理解,以及 **答案生成** ,从直接预测到逐步的思想链(CoT)推理。我们回顾了增强数学推理的方法,从无训练提示到微调方法,如监督微调和强化学习,并讨论了最近在扩展CoT和“测试时间缩放”方面的工作。尽管取得了显著进展,但在能力、效率和普及方面仍然存在根本挑战。为了解决这些问题,我们强调了有前途的研究方向,包括先进的预训练和知识增强技术、正式推理框架以及通过原则性学习范式的元概括。这项调查试图为有兴趣提高LLM的推理能力的研究人员和那些寻求将这些技术应用到其他领域的研究人员提供一些见解。 #### 学习机制

arXiv 2506.06034(原综述笔记,标题缺失)

原主题综述区残留的 arxiv 链接,标题已佚,仅保留链接。

 推理

📝 原始笔记(逐字保留)
2025-06-10 10:57:06 Tuesday 2. **链接** :https://arxiv.org/abs/2506.06034
0%