人工智能 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 人工智能 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) AI辅助编程 5 LLM 能否设计视频编码工具?Planar 模式案例研究 09-02 Claude Code 推出 Hooks 功能,让 AI 编程走向可控工程化 07-02 Gemini CLI 开源并免费提供 06-26 腾讯元宝推出 AI 编程模式,支持代码实时预览 06-19 ChatGPT 向普通会员开放 Codex 06-04 三维生成 1 谢赛宁团队新作:无需提示词实现精准3D画面控制 12-31 三维重建 1 CVPR 2025 Award Candidate:Difix3D+ 用单步扩散模型修复 3D 重建伪影 06-23 专家智能 1 AAI 推动人工专家智能新路径 12-31 世界模型 2 谷歌 DeepMind 发布新一代通用世界模型 Genie 3 08-05 Meta 发布世界模型 IntPhys 2 06-12 中期训练 1 首创 Mid-training 范式破解 RL 奥秘,Llama 推理性能追平 Qwen 07-01 产品动态 1 介绍新伙伴:豆包工作 08-25 产品更新 1 OpenAI 上线会议记录功能与 MCP 连接器 06-05 人工智能人才培养 1 交大高金推出AI时代硬核EMBA「科技强国计划」全额奖学金 08-07 人工智能人才招聘 1 清华大学与智谱联合培养博士后招聘启事 07-18 人工智能竞赛 1 国家级AI创新应用赛事启动:超200万元奖金池与全场景赛道 08-15 人工智能药物研发 1 Chai-2实现零样本抗体发现,AI设计药物有望进入临床 07-02 人机协作 1 人类与人工智能的文本生成和理解:跨学科研讨会报告 06-28 代码模型 1 Claude Opus 4.1 发布,SWE-bench 成绩提升至 74.5% 08-05 低资源学习 1 面向低资源大模型任务的可迁移提示与对齐策略 07-01 偏好优化 2 使用规则引导的合成数据进行可配置偏好调优 06-16 隐式奖励作为桥梁:SFT 与 DPO 连接的统一视图 06-15 元认知 3 元优化与元认知:从训练效率到模型自我反思 08-06 推理模型如何识别无益想法并从中恢复? 06-13 大型语言模型具有内在元认知,但需要良好的评估透镜 06-12 具身基础模型 1 地平线与极佳提出几何一致视频世界模型,增强机器人策略学习 06-27 具身智能平台 1 华为发布 CloudRobo 具身智能平台 06-26 内在反馈 1 RLIF:利用模型内在置信度实现无外部监督的强化学习 12-31 决策说服 1 LLM 中理解与说服之间的细线 07-03 分层推理 1 借鉴人类思考的分层推理:清华大学最新研究 08-05 创造力评测 1 人类创造力的核心机制,AI 已开始掌握:IEI 分层评估框架 06-26 前沿挑战 1 大模型强化学习的关键挑战与下一代范式 12-31 动态评测 1 仇恨革命:静态基准没有告诉我们什么 12-31 医疗人工智能应用 1 真·全民 AI 健康管家来了!实测蚂蚁 AQ 07-01 博弈评测 1 谷歌首届大模型对抗赛:DeepSeek、Kimi 等模型同场博弈 08-04 反馈规划 1 KRCL:借鉴人类运动学习反馈的双向闭环规划机制 12-31 因果推理 1 揭示大型语言模型中的因果推理:现实还是海市蜃楼? 06-27 图像生成 2 GenFirst:先生成后重建的稳定端到端潜在生成建模 09-02 国产统一图像生成模型 OmniGen 2.0 发布,理解与生成质量双提升 12-31 在线训练 1 桥接大语言模型的离线与在线强化学习 06-27 基础模型 1 中国移动发布九天基础大模型3.0,性能提升35% 07-26 复杂环境 1 智能体迈向复杂环境交互 12-31 多智能体协作框架 2 蚂蚁集团开源多智能体协作基础设施 Avernet 08-11 昆仑万维 Skywork 发布分层多智能体协作框架 AgentOrchestra 07-17 多智能体系统 1 许多 LLM 比一个更实用:多智能体协作中的道德判断 07-01 多模态学习 2 阶跃星辰发布多模态旗舰基座模型 Step 3 12-31 快手开源视频理解大模型 Keye-VL 06-27 多模态推理 1 推理越多,幻觉越重?多模态推理模型的「幻觉悖论」 06-26 多维推理 1 突破思维模式:面向大语言模型的多维推理框架 06-18 奖励建模 5 响应级奖励就是 LLM 在线强化学习所需的一切:数学视角 12-31 周志华团队理论证明:LLM中可挖掘内源性通用奖励模型 07-03 RewardAnything:用自然语言定义通用奖励原则 06-27 奖励模型也能 Scaling:上海 AI Lab 提出策略判别学习新范式 06-24 从通用奖励到定向奖励:在开放式长文本生成任务中超越 GPT-4 06-23 学习认知 1 揭开语言模型的学习心智:认知框架与实证研究 06-18 学术论文 1 arXiv 论文 2508.05748 12-31 学科应用 1 LLMs4All:面向学科研究与应用的大型语言模型综述 09-26 实时辅助 1 Cluely 推出面向面试、考试与销售电话的实时 AI 辅助工具 06-30 对齐优化 1 基于动态奖励加权的多目标对齐优化学习 09-16 并行推理 1 腾讯AI Lab俞栋团队开源首个并行思考强化学习框架 Parallel-R1 12-31 幻觉检测 1 HARP:通过推理子空间投影进行幻觉检测 09-15 幻觉评测 1 苹果再发论文:精准定位 LLM 幻觉,GPT-5、o3 仍难应对 12-31 开源模型 3 百度文心大模型 4.5 系列正式开源并提供 API 服务 07-01 华为开源盘古 Embedded 7B 与盘古 Pro MoE 72B 模型 07-01 MiniMax开源MiniMax-M1模型并公开技术报告 06-17 开源社区 1 7万个模型、1600万开发者:魔搭已建成中国最大AI开源社区 07-01 引导生成 1 ICML 2025 Spotlight:流匹配模型的能量引导生成理论框架 06-30 强化学习 2 清华、上海AI Lab等团队发布推理模型强化学习综述 12-31 大型推理模型的强化学习研究综述 09-11 形式化证明 2 AI 辅助攻克森多夫猜想,陶哲轩推导出更强结果 08-16 阶跃星辰发布并开源 StepFun-Prover 系列形式化定理证明模型 12-31 心智理论 1 ToMAP:以心智理论训练具备对手感知能力的大模型说服者 06-25 忠实性验证 1 以因果验证机制检验 AI 推理忠实性 12-31 思维框架 1 姚期智领衔提出大模型“思维”框架,逻辑推理正确率达98% 09-23 思维链 3 重新定义思维链的角色:线索而非完整解释 12-31 Bengio等质疑CoT忠实度:语言化步骤未必反映LLM真实推理 07-03 CoT-Bridge:为模型补上思维跳跃的“桥梁” 06-04 思维链监测 1 CoT监测或成为控制AI智能体的核心方法 07-17 性能优化 1 ChatGPT长对话提速与Codex多智能体v2上线 08-16 情感交互 1 Anthropic 最新研究:Claude 正悄悄进化为“情绪价值大师” 06-28 意识表征 1 能否从大型语言模型内部状态中观察到“意识”?基于综合信息理论与 Span 表示的分析 07-01 成本定价 1 Token 成本下降,AI 订阅费为何持续上涨? 12-31 截稿日历 1 CCF 人工智能会议 2027 投递与截稿指南 08-29 扩散模型 2 Mercury:首个扩散式 LLM,推理速度超过主流模型 7 倍 06-28 DiffuCoder:理解并改进用于代码生成的掩码扩散模型 06-25 技术生态 1 AI4AI 从自进化、元进化迈向递归自我改进 08-12 技术趋势 3 持续学习赛道升温:Karpathy称仍需十年 08-11 AI学会自我进化:潜在的领域突破 07-27 人工智能流程:观点、场景和方法 06-18 持续学习 2 持续学习向系统级适应的范式转型 08-07 GeRe:通过通用样本重放缓解大模型持续学习中的灾难性遗忘 08-06 指令数据合成 1 Infinity Instruct:扩展指令选择与合成以增强语言模型 06-16 推理优化 1 马尔可夫思考机将 LLM 推理成本降至线性 12-31 推理扩展 1 五年前的“开放式推理”设想预见 OpenAI o1、o3 路线 08-15 推理效率 1 Long-to-Short 是免费的午餐吗?研究大型推理模型的一致性与推理效率 06-25 推理早停 1 答案收敛可作为推理早停信号 06-04 推理模型 2 大推理模型强化学习综述 12-31 蚂蚁开源 Ling-flash-2.0 MoE 模型,小参数量实现越级推理性能 12-31 推理研究综述 2 香港中文大学发布基础模型推理能力综述:方法、基准与未来方向 10-23 逻辑学研究中心联合发表大模型逻辑推理能力综述《思维机器》 10-15 推理范式 1 CMU 与斯坦福提出新型推理范式:让 LLM 自主发现抽象“窍门” 12-31 推理评测 6 组合深度并非可靠的推理复杂度指标 12-31 从思考到输出:推理语言模型中的思维链与文本生成特征 06-30 大语言模型的“波将金式理解”:正确答案背后的推理不一致 06-21 苹果《思考的错觉》再遭质疑:Claude与人类共著论文指出三大测试缺陷 06-20 苹果《思考的错觉》再遭质疑:Claude 与人类共著论文指出三大关键缺陷 06-14 《思考幻觉》的幻觉:重新审视大模型推理能力崩溃 06-14 推理调控 1 AlphaOne:大模型先慢后快的测试时推理调控框架 06-23 推理迁移 1 数学推理训练能否提升 LLM 的通用能力?推理能力的可转移性研究 07-01 推理预算 1 通过预算引导控制大模型思维长度 06-18 搜索能力评测 1 Mind2Web 2:基于 Agent-as-a-Judge 的智能体搜索评估 06-27 数学推理 8 哈萨比斯:数学 AI 的“第37手”只是时间问题 08-11 OpenAI与DeepMind在IMO 2025中均攻克5道题 12-31 OpenAI IMO 金牌团队:模型拒答难题,长时推理面临评估瓶颈 12-31 AI Mathematician(AIM)框架探索前沿理论研究 12-31 大语言模型的数学推理:代码合成、证明生成与逻辑状态 08-05 仅靠提示词与自我验证,Gemini 2.5 Pro 达到 IMO 2025 金牌水平 07-21 有道开源14B「子曰3」数学模型,多项任务超越DeepSeek-R1 06-28 大语言模型数学推理综述 06-12 数据质量 1 评估数据质量在训练双语语言模型中的作用 06-18 文本扩散模型 1 Cosmos:用于文本扩散建模的压缩平滑潜在空间 06-27 旗舰模型 1 GPT-5 来了:免费开放,主打简单易用 12-31 时间序列模型 1 清华发布首个万亿级时间点预训练生成式时序大模型「日晷」 06-23 智能体框架 1 腾讯 AI Lab 开源层次化智能体框架 Cognitive Kernel-Pro 12-31 智能体研究综述 1 自进化智能体综述:迈向人工超级智能之路 07-28 智能体网络 1 Agentic Web:由 AI 智能体驱动的下一代互联网生态 12-31 智能体自进化 2 自进化智能体技术最新综述:迈向人工超级智能 12-31 普林斯顿王梦迪团队综述:自我进化智能体的持续学习与适应 08-01 智能体训练 1 上交大新范式:78条高质量样本胜过万条数据 09-28 智能体记忆 1 Memory+Agent:人大高瓴与华为诺亚构建大模型智能体记忆研究体系 08-08 智能体评测 6 AI Agent 评测的四大演进趋势 12-31 AI Agent 与传统聊天机器人的本质区别及科学评测方法 07-17 LLM 智能体与传统聊天机器人的本质区别及科学评测 07-03 RExBench:评估 LLM 智能体实现研究扩展的能力 07-01 基于LLM的人工智能代理评估的进化视角:全面综述 06-16 测量数据科学自动化:AI 助手与智能体评估工具综述 06-12 智能浏览器 1 首个 AI 原生浏览器 Dia 正式启动内测 06-15 机制可解释性 1 首篇稀疏自编码器系统综述:解析大模型内部机制 06-23 机制学习 1 理解底层运行机制:从信息宇宙到可学习的潜在结构 10-20 机制研究综述 1 大语言模型智能体记忆机制综述 12-31 架构发现 1 AI 架构发现呈现“科学发现的规模法则” 12-31 架构搜索 1 ASI-ARCH 自主发现 106 种线性注意力架构 12-31 校园招聘面试 1 字节跳动 2027 校招重点 AI 岗位真题合集 08-26 桌面端应用 1 ChatGPT Linux 桌面版开放预览,集成 Work 与 Codex 08-15 概念研究综述 1 什么是 Self-evolving、Self-improving 与 RSI? 08-12 模型发布 10 Grok 4.6 发布:智能体能力与性价比显著提升 08-14 GLM-5.3:后训练扩展强化编程与网络攻防能力 08-14 Qwen3-Max-Preview(Instruct)发布 09-15 OpenRouter 神秘模型 Cypher Alpha 上线 07-03 小红书开源首个多模态大模型 dots.vlm1,性能直追 SOTA 07-02 Gemini 2.5 Pro 稳定版全面可用 06-19 豆包大模型 1.6 发布 06-12 Mistral AI 发布推理模型系列 Magistral 06-12 Gemini 2.5 Pro 0605 版本发布 06-06 Cursor 更新至 1.0 版本 06-05 模型对抗 2 Grok 4晋级大模型对抗赛决赛,Gemini全军覆没 12-31 o3 以 4:0 横扫 Grok 4,夺得首届大模型对抗赛冠军 12-31 模型微调 1 MokA:面向多模态大模型的低秩适配微调新范式 06-30 模型架构创新 2 Qwen3.8-Next 架构设计:效率、能力与训练稳定性的联合优化 09-02 ASI-ARCH:从神经架构搜索迈向自主架构创新 12-31 模型架构演进 1 模型架构发现的 AlphaGo 时刻:ASI-Arch 07-24 模型评测 4 GPT-5 首波实测:SimpleBench 超越人类平均水平 12-31 Kimi-2 上线 LiveBench AI,评测超越 GPT-4.1 07-17 SuperCLUE推理榜惊现黑马:中兴AI模型表现亮眼 07-02 心理语言学词特征:评估 LLM 与人类一致性的新方法 07-01 模型验证 3 OpenAI以「通用验证器」推动GPT-5全领域能力提升 12-31 CompassVerifier:跨领域验证 LLM 输出的轻量级模型 12-31 CompassVerifier:统一支持 LLM 评估与结果奖励的鲁棒验证器 08-06 泛化 1 GPT-5数字母任务仍翻车:CoT分布外泛化问题未解 12-31 泛化推理 1 General-Reasoner:面向跨领域泛化的推理框架 06-04 泛化迁移 1 打破领域障碍:强化后训练的推理收益能否迁移到未见领域? 06-25 测试时计算 1 e3:学习探索实现大模型测试时计算外推 06-12 浏览器 1 浏览器智能体 Fellou 2.0 发布 06-04 涌现机制 1 为什么 LLM 的能力是涌现的? 08-06 涌现能力 1 大型语言模型与涌现:复杂系统视角 06-16 深度研究智能体 1 深度研究智能体重塑知识发现与问题解决范式 08-07 混合微调 2 SRFT:单阶段融合监督与强化学习的大模型微调方法 07-03 SRFT:统一监督微调与强化学习的单阶段推理训练方法 06-25 混合规划 1 融合神经与符号系统的混合规划器 12-31 游戏发布 1 米哈游公布UE5写实奇幻新作《源初之结》 08-26 游戏推理 2 ViGaL:用街机游戏训练多模态模型的跨领域推理能力 06-18 玩以致泛化:通过游戏学习推理 06-09 游戏生成 2 OpenAI Astra 一次生成类 GTA 游戏 08-31 ViGaL:以游戏化合成任务培养通用多模态推理能力 12-31 物理仿真 1 Genesis:面向具身 AI 的生成式物理引擎 12-31 理解能力评测 1 大型语言模型中的波将金式理解 06-27 理论评测 1 Courcelle 算法元定理保证一类问题的可解性 08-15 生成式评测 1 双模型生成与评判机制 12-31 生物医学人工智能 1 DeepMind 发布突破性生物模型 AlphaGenome 06-27 监督学习 1 生成式视角重塑监督学习:预测一致性学习让标签成为学习指南 06-25 真值表征 1 探索真理的几何学:LLM 真值方向在逻辑变换与问答任务中的一致性和泛化性 06-04 研究方向 2 无需外部数据!AI自问自答实现推理能力进化 12-31 智能体的自主决策与递归自我改进 12-31 研究观点 1 强化学习之父:大语言模型是一个错误的起点 12-31 社会仿真 1 LearnerAgent:使用 LLM 智能体模拟类人学习动态 08-07 科研品味 1 秦兵:大模型时代的科研品味 08-12 科研奖项 1 青年科研人看过来!2025“蚂蚁InTech奖”启动 07-03 科研应用 1 AI4Research:人工智能赋能科学研究综述 07-02 科研评测 1 构思与执行差距:LLM 与人类研究理念的执行结果比较 06-27 程序进化 2 AlphaEvolve:谷歌让 AI 通过代码实现自我进化 12-31 达尔文哥德尔机:开放式进化的自我改进智能体 05-29 端侧模型 1 Google DeepMind 发布端侧 VLA 模型 Gemini Robotics On-Device 06-26 答案验证 1 CompassVerifier:面向多领域答案评估与奖励的轻量级验证模型 12-31 策略优化 1 Qwen3 提出 GSPO:从序列级重要性采样改进 GRPO 12-31 算法发现 1 AlphaEvolve:结合大语言模型与自动评估实现算法自我进化 12-31 系统优化 2 华为 CloudMatrix 384 超节点很强,但它的“灵魂”在云上 07-03 华为 CloudMatrix 论文披露 AI 数据中心新范式,推理效率超越英伟达 H100 06-30 编程工具 1 字节跳动 AI 编程工具 TRAE 2.0 即将发布,新增语音交互 07-17 缩放定律 2 智谱唐杰:大模型只看参数的时代结束了 08-20 能力显著性向量:面向下游任务缩放定律的损失—能力细粒度对齐 06-18 能力提升 1 GPT-5 幻觉减少,空间推理与规划能力提升 12-31 能力评测基准 1 FormulaOne 基准令 GPT-5、o3 Pro 等前沿模型集体零分 12-31 自主智能体 1 月之暗面推出 Kimi-Researcher,自主 Agent 在“人类最后一场考试”取得 SOTA 06-23 自动化科研 1 自我加速 AI 系统蓝图:开放框架、架构与认知轨迹 12-31 自动化评测 1 文本、视觉和语音生成自动评估方法综述 06-13 自我学习 1 MIT SEAL:通过自生成数据与权重更新实现模型自我适应 12-31 自我改进 2 哥德尔机:可证明的递归自我改进构想 12-31 多游戏联合训练促进自主智能体技能协同 08-05 自进化 4 Alita:可自主创造 MCP 工具的极简通用智能体 12-31 Meta:智能体无需奖励或模仿,利用早期经验主动学习 10-11 普林斯顿 Alita 开启通用智能体自主进化新范式 06-04 DeepMind 发布 AlphaEvolve,以进化算法广度探索解空间 05-14 航天控制 1 MIT研究:大语言模型自主操控飞船,Llama实现零失败率 07-03 蛋白质建模 1 清华AIR与上海AI实验室发布蛋白质基座模型 AMix-1 12-31 行业动态 2 AI彻底不当人了?Anthropic这波“自我进化”骚操作,看得我人已麻 12-31 苹果公布全产品线 AI 融合计划 06-10 行业报告 1 2025年AI现状报告:AI构建者手册 07-01 表征分析 1 表示空间分析工具:PCA、CKA 与 Fisher 信息矩阵 06-14 裁判模型评测 1 LLM 作为评委的实证研究:设计选择如何影响评估可靠性 06-18 规则推理 1 RuleReasoner:通过领域感知动态采样强化规则推理 06-12 规模扩展瓶颈 1 Orion性能未达预期,三大瓶颈制约模型扩展 12-31 视觉模型 3 大模型时代,通用视觉模型将何去何从? 12-31 清华鲁继文团队综述通用视觉模型研究进展 12-31 纯视觉范式下的通用视觉模型研究回顾与总结 07-03 视觉通才模型 1 视觉通用模型综述(Vision Generalist Model: A Survey) 12-31 视频数据 2 多机构联合推出持续迭代的视频数据集项目 Sekai 12-31 浙大开源UltraVideo超高清视频数据集,推动原生4K视频生成 07-02 视频生成 3 MuseSteamer登顶VBench图生视频榜单 12-31 百度搜索十年来最大改版,MuseSteamer 与 AI 视频平台「绘想」上线 07-03 MiniMax 发布海螺 2.0,原生支持 1080P 06-19 计算复杂度 1 思考的错觉:从问题复杂性理解推理模型的优势与局限 06-11 认知习惯 1 了解大型推理模型的认知习惯:CogTest 基准评估 06-30 认知工具 1 用认知工具在语言模型中激发推理 06-18 认知推理 1 借鉴认知科学提升 AI 推理解释的真实性 12-31 训练优化 1 两篇 ICLR 论文破解强化学习的两个关键难题 07-18 记忆机制 1 通过电路发现理解 LLM 中的逐字记忆 06-30 论文写作 1 1947篇AI顶会论文揭示高质量论文写作法则 08-14 论文转投 1 NeurIPS、AAAI 失利后的 2027 顶会转投时间表 08-20 评测争议 1 GPT-5 编程成绩被质疑:删去 23 道测试题,关键基准由自己提出 08-07 评测可靠性 1 使用开放基准测试评估语言模型的陷阱 07-01 评测基准 2 LLM 评测基准综述与多模态推理新基准 10-23 剖析 SWE-Bench 排行榜:LLM 与智能体修复系统的提交者及架构画像 06-24 语言反馈 1 可证明地从语言反馈中学习:HELiX 算法与理论框架 06-13 语音模型 1 首个全面梳理语音大模型发展脉络的权威综述入选 ACL 2025 主会 06-18 趋势分析 1 小宇宙《2026 AI趋势报告》:协作型AI、AI创作与办公升温 08-26 趋势预测 1 2026—2027年大模型行业两大里程碑 08-12 跨模态对齐 1 LIFT:冻结LLM文本编码器,准确率超CLIP 11% 07-03 软件开发方法 1 按交付周期选择软件开发方法论 12-31 轻量化模型 1 谷歌开源 Gemma 3 270M 模型 12-31 过程奖励模型 1 SPRO:使用掩码步骤优势进行自我引导的过程奖励优化 07-02 进化建模 1 AI可高效建模由进化形成的复杂系统 12-31 进化搜索 1 LLM 引导的进化搜索:通向超级智能混合系统的新方向 12-31 进化算法 1 谷歌将大语言模型引入进化算法,实现代码自我迭代 12-31 连续推理 1 田渊栋团队:连续思维链通过“叠加态”实现多路径并行推理 06-20 递归自我改进 1 综述:递归自我改进(RSI)的能力边界与关键瓶颈 08-13 通用推理 1 RLPR:无需验证器将RLVR扩展到通用领域 06-28 通用智能体 1 OpenAI 通用智能体 ChatGPT Agent 正式发布 07-18 逻辑增强 1 FLARE:忠实的逻辑辅助推理与探索 10-16 逻辑推理 2 ACL 2025:让 LLM 像逻辑学家一样思考 07-28 清华推出“AI数学家”:可自主调用定理并构建证明思路 06-04 错误模式 1 更强大的语言模型会产生更多类似人类的错误 06-16 长期记忆 1 M+:以协同检索器扩展 MemoryLLM 的可扩展长期记忆 08-08 长视频理解 1 HoPE 混合位置编码提升视觉语言模型的长度泛化能力 06-30 隐私风险 1 微调方法对大型语言模型中记忆的影响 06-30 顶级学术会议成果 1 小米 8 篇大模型与智能体论文入选 EMNLP 2026 08-29 预训练 2 强化学习也能预训练?潜在意图与流匹配带来最高20倍提升 06-30 「Next-Token」范式改变:强化学习预训练来了 06-12 领域微调 1 ICML 2025 Spotlight|清华朱军组与 NVIDIA 提出 DDO,革新扩散与自回归模型训练 07-02 领域泛化 1 从一般推理到领域专业知识:揭示大型语言模型泛化的局限性 06-30 额度异常检测 1 Codex 额度异常查明:自动标题等三处 Bug 导致超额消耗 08-24 验证器模型 1 CompassVerifier:3B验证模型与多领域高难度基准 VerifierBench 12-31 高效探索 1 字节跳动与MAP提出FR3E:以结构化高效探索提升大模型强化学习上限 12-31