数据策展 LLM-DailyDigest 2026-08-20 2026-08-20 约 100 字 预计阅读 1 分钟 数据策展 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 体裁扩展 1 属性引导的多体裁创意写作数据扩展 08-21 动作纠错 1 SportSkills:从体育教学视频学习身体技能并按动作错误检索示范 08-24 地理课程 1 基于地理隔离的可扩展遥感自监督学习 08-22 指令精炼 1 指令质量决定偏好学习效果:基于奖励与规则的指令精炼 08-29 数据合成 2 RailSyn:面向铁路异物检测的诊断引导图像生成 09-01 什么是优质智能体数据?基于 ACE 视角的数据生成框架 08-28 数据混合 2 难度感知数据策展缩小文档 VLM 成本与质量差距 09-02 工业级 LLM 后训练:面向棕地维护的 Dataware 工程 09-01 数据策展 3 从重加权到响应重写:释放影响样本的训练干预效应 09-03 蚂蚁OmniTable统一宽表管理35PB大模型训练数据 09-02 基于失败模式上下文赌博机的对抗数据策展 08-20 界面移除 1 Game2World:清理游戏 UI 以扩展世界模型训练数据 08-27 肌电数据采集 1 OriginFlow以神经肌电构建具身智能Human Tokens 08-23 自演化数据合成 1 VISA:面向多模态指令遵循的智能体自演化数据合成 08-27 评测基准构建 1 BTS-AgentBench:从只读遥测日志构建可复现智能体基准 08-28 轨迹筛选 1 SWE-Prime:更少轨迹实现更强软件修复性能 08-28 过滤式微调 1 TailSFT:过滤式微调提升强化学习后训练性能 08-27 逆合成分析 1 化学合理性感知大模型用于单步逆合成 08-21