测量效度 LLM-DailyDigest 2026-08-16 2026-08-16 约 100 字 预计阅读 1 分钟 测量效度 本主题由提交工具自动创建,可在此补充洞察与资料。 相关消息(按子主题自动聚合) 低资源推理 1 低资源语言推理:SFT 构建语言习惯,RL 修复行为缺陷 08-19 多样性评测 1 用多样性剖面评估 AI 生成内容 08-19 对应审计 1 跨视图对应是一种测量干预:智能体评测与信用分配的双向验证 08-19 探针效度 1 探针方向由提示词决定,而非模型属性 08-16 评测审计 2 SASST:面向交互式智能体的选择感知压力测试 09-01 Phantom Gains:用实测零基线审计模型自我改进 08-21 运动跟踪 1 HumanTracker:人类感知对齐的人形运动追踪基准 08-18 量规评分 1 评分靠量规,而非模型智能 08-19 题项相似性 1 双维度 LLM 框架自动分析大规模测评题项内容相似性 08-26