博弈论 LLM-DailyDigest 2026-08-30 2026-08-30 约 100 字 预计阅读 1 分钟 博弈论 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 世界模型 2 通用决策大模型 Decitron:开放世界推演与求解闭环 09-03 NashDreamer:面向零和不完美信息博弈的模型式强化学习 09-02 主动学习 1 ATGen:面向自然语言生成的主动文本生成框架 07-01 协作博弈 1 推理腐蚀:推理语言模型成为公共产品博弈中的搭便车者 07-01 博弈推理 1 以玩促泛化:通过游戏学习推理 06-11 博弈智能体 2 DipLLM:以少量数据微调大模型的外交博弈智能体框架 07-02 TextAtari:语言智能体仅用 10 万帧完成游戏学习 06-09 博弈评测 4 Game Arena:以游戏评估 AI 的复杂推理与规划能力 08-07 Grok 4夺得首届大模型国际象棋对抗赛冠军 08-07 Board Game Arena:通过策略游戏评估大型语言模型的框架与基准 08-05 谷歌首届大模型对抗赛:DeepSeek、Kimi 等模型同场博弈 08-04 多智能体系统 3 双层协调反思:多智能体 LLM 系统的博弈论方法 09-03 许多 LLM 比一个更实用:多智能体协作中的道德判断 07-01 从辩论到均衡:基于贝叶斯纳什均衡的信念驱动多智能体 LLM 推理 06-12 奖励机制 1 结果奖励驱动可泛化推理策略 12-31 定价机制 1 LLM 推理服务的默认设计与 Token 定价 08-16 心智理论 1 Decrypto:多智能体推理与心智理论基准测试 06-26 技能演化 1 清华推出 Ctx2Skill:通过多智能体自博弈实现 Skill 自主进化 08-12 推理强化 1 SPIRAL:强化学习筛选并强化可泛化推理模式 12-31 模型对抗 2 Grok 4晋级大模型对抗赛决赛,Gemini全军覆没 12-31 o3 以 4:0 横扫 Grok 4,夺得首届大模型对抗赛冠军 12-31 研究方向 1 无需外部数据!AI自问自答实现推理能力进化 12-31 群体风险 1 Anthropic揭示多智能体协作、合谋与冲突隐患 08-16 能力迁移 1 不同游戏训练会形成专门化认知能力 12-31 自博弈 7 SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」 12-31 零和博弈自对弈驱动模型自主学习推理 12-31 SPIRAL:通过多智能体多轮强化学习在零和博弈自博弈中激励推理 12-31 SPIRAL 强化学习代码仓库 12-31 以游戏自对弈筛选可泛化思维链 12-31 SQLM:非对称自我博弈框架 12-31 SPIRAL:零和博弈自博弈激发可迁移推理能力 06-30 自我提问 1 SQLM:无需外部数据的自我提问模型框架 12-31 自我改进 1 多游戏联合训练促进自主智能体技能协同 08-05 辩论式对齐 1 辩论训练减少 RLAIF 奖励作弊 08-19 默契合谋 1 AI 智能体在算法化电力市场中涌现默契合谋 08-29