逻辑推理

逻辑推理

未来的评估体系将具有高度可扩展的发展路径。

挑战:如何优化统一框架设计、提高训练效率和应对大规模数据等挑战。

老数据也可以有新用途。

为此,我正在打造一个可扩展的通用数据引擎。

强调自主决策

关注正确率到关注效率、安全与社会价值。

计算机科学中的逻辑:https://arxiv.org/list/cs.LO/recent

计算机科学与博弈论:https://arxiv.org/list/cs.GT/recent

相关消息(按子主题自动聚合)

一致性评测 1

主动推理 1

代码评测 1

任务生成 1

低成本训练 1

元认知 2

分层推理 2

协作合成 1

协同演化 1

博弈推理 1

博弈评测 4

原型推理 1

反例推理 1

反思回溯 1

反馈优化 1

句子简化 1

可信推理 2

可扩展推理 1

可验证奖励 1

可验证推理 1

因果推理 2

图逻辑 1

复合推理 1

多元推理 1

多智能体系统 1

多模态推理 1

多模态证明 1

多维推理 1

多路径推理 1

多跳推理 3

多轮验证 1

奖励黑客 1

工具推理 1

并行推理 2

开放式推理 1

形式化工具 1

形式化推理 1

形式化证明 8

形式化验证 1

心智理论 1

忠实性验证 1

思维框架 1

思维链 3

批评微调 1

技能自博弈 1

探索推理 1

推测解码 1

推理异常 1

推理归因 1

推理扩展 1

推理效率 3

推理模型 1

推理研究综述 2

推理范式 1

推理蒸馏 1

推理评测 14

推理调控 1

提示优化 1

效率评测 1

数学合成 1

数学推理 10

数学研究 1

数学评测 1

数据合成 3

数理语言 1

时序逻辑 1

本体推理 1

机制学习 1

概率推理 1

模型可靠性 1

模型安全 1

模型对抗 2

模型架构创新 1

模型评测 3

泛化 1

泛化推理 1

混合微调 1

游戏推理 3

游戏评测 1

理论评测 1

真值表征 1

知识推理 1

神经符号人工智能 3

科研应用 1

科研评测 1

空间推理 1

答案聚合 1

组合推理 1

结构推理 1

缺失前提识别 1

能力提升 1

自博弈 1

自我反思 1

自我批判 1

自我改进 1

自进化 2

自适应引导 1

自适应推理 1

航天控制 1

融贯性审计 1

规则推理 2

视觉推理 2

计算复杂度 1

认知习惯 1

认知推理 1

认知链 1

论证补全 1

证明语料库 1

评测偏差 1

评测基准 1

评测审计 1

语言推理 1

课程学习 1

谜题生成 1

谜题评测 1

连续推理 1

逻辑增强 1

逻辑推理 2

逻辑生成 1

逻辑评测 1

金融推理 1

错误反思 1

错误模式 1

隐含前提识别 1

领域修复 1

领域泛化 1

首步纠错 1

0%