后训练

后训练

本主题由提交工具自动创建,可在此补充洞察与资料。

相关消息(按子主题自动聚合)

主权人工智能模型 1

人群仿真 1

价值估计 1

低资源推理 1

偏好优化 2

分布式训练 1

反思优化 1

同策略蒸馏 1

奖励优化 1

奖励蒸馏 1

对齐失配 1

尺度解耦 1

工具使用训练 2

师生协同适应 1

强化学习后训练 1

思维链 1

意图拒绝 1

扰动推理 1

持续后训练 1

持续推理 1

排序蒸馏 1

数据合成 1

数据混合 1

智能体强化学习 1

智能体微调 1

机器遗忘 1

框架拆解 1

模型发布 3

模型微调 1

模型训练 2

模型评测 1

流形漂移 1

漏洞训练 1

知识内化 1

科研智能体 1

端侧框架 1

策略优化 2

策略固化 1

策略蒸馏 1

经验授权 1

自蒸馏 1

蒸馏平衡 1

融合范式 1

训练策略 1

训练系统 1

评测审计 1

资源调度 1

过滤式微调 1

过程奖励模型 1

进化策略 1

逆合成分析 1

0%