2025-07-26 科研追新

当日精选(由提交工具自动创建)。

GLM-4.5 逻辑能力评测:推理模式显著降低幻觉与计算误差

GLM-4.5 基础模式存在明显的幻觉、计算误差和暴力穷举倾向,而推理模式在准确性与稳定性方面有显著改善。

 模型开发 模型评估 推理 逻辑推理

GLM-4.5 基础模式会对输入和自身输出产生幻觉,包括引用不可访问的图片、用占位符代替统计结果,以及遗漏报告核心观点等。其数学计算容易在过程中累积小错误,导致最终答案看似合理但实际不正确;相比之下,推理模式在函数求交和年报数据汇总等任务中准确率明显更高。面对数独、解密和数字规律等复杂问题,基础模式约有半数概率采用暴力穷举,少数输出还可能陷入死循环。新版发生死循环的比例已降至 2% 以下,但推理模式在个别高难度任务中仍会出现穷举行为。

用途与启示
  • 评估 GLM-4.5 时应区分基础模式与推理模式,避免以单一运行结果概括整体能力。
  • 对数学计算、报告提炼等高可靠性任务,优先启用推理模式并增加结果校验。
  • 可将无效引用、占位符、暴力穷举和死循环纳入模型幻觉与稳定性评测指标。
  • 训练数据清洗和复杂任务的搜索策略约束,可能是后续优化重点。
📝 原始笔记(逐字保留)
1. 逻辑能力 1. 幻觉过重:基础模式的幻觉是全方面的,不但对prompt输入本身存在幻觉,其输出有时也存在“梦游”现象,输出一些自己也不知道是什么的内容。比如在输出中试图引用一张图片来解释原理,但图片Url无法访问。大概是训练材料混入的脏数据。#42报告提炼问题,基础模式放弃了计算统计数据,使用占位符,对报告中核心观点的摘要也提炼不完整。在仅有的1pass中虽然计算了统计值,但计算错误。不过好在推理模式中,幻觉控制要好的多,没有出现类似问题。相关问题表现达到推理模型平均水准。 2. 计算误差:受幻觉影响,基础模式数学计算误差显著偏高,以#38函数求交尤为典型,在kimi-k2的误差中,往往是小数点第3位之后的精度问题,按四舍五入算大体是对的。而GLM-4.5的误差体现在计算过程中小错误不断积累,最终答案只是看起来像,实际完全不对。同样由于推理模式对幻觉的抑制有效,同样题目在推理模式下准确率极高,#38题稳定满分,#42年报报告提炼问题中数据汇总部分也基本没有问题,偶有误差。 3. 暴力倾向:对于复杂问题,基础模式2个版本有半数几率使用暴力穷举,在中等难度的#36六阶数独问题如此,在难题#23解密,#24数字规律等问题同样如此。在没有使用穷举的轮次中,二者均能正常响应,输出虽然不满分,但在同梯队中表现尚可的答案。值得一提的是,GLM前一个版本air-0414和Z1也因为过多使用暴力穷举,导致模型输出极易陷入死循环而耗尽Token,新版则只在少数(低于2%)输出死循环,大部分穷举Badcase是真的在穷举。**推理模式**下也存在同样问题,但概率较小,仅在个别高难度问题如#43目标数,#44工具组合,中有体现。 ## 2025-7-26

中国移动发布九天基础大模型3.0,性能提升35%

中国移动焕新发布九天基础大模型3.0,通过端到端技术升级实现性能提升,并进一步增强生成内容的可控性。

 模型开发 多模态 人工智能 模型训练

2025年7月26日,在世界人工智能大会期间,中国移动发布九天基础大模型3.0。新版本聚焦端到端技术升级,整体性能据称提升35%。模型同时增强了生成可控性,并支持更便捷的图像编辑能力。九天3.0延续“高安全、高可控、全国产、全行业”的定位。

用途与启示
  • 为运营商及行业客户提供自主可控的基础模型能力
  • 强化可控内容生成与图像编辑等多模态应用
  • 展示国产大模型在安全性、可控性和行业落地方面的升级方向
📝 原始笔记(逐字保留)
2. [九天大模型大变身:性能狂飙35%!还能一键P大象](https://mp.weixin.qq.com/s/3VkR9VBaSs6eMZEaWqfdYg) 1. 7月26日,在2025世界人工智能大会期间,中国移动焕新发布「九天」基础大模型3.0。本次发布的「九天」基础大模型3.0,重点聚焦模型的端到端技术升级以及生成可控性能力的增强,进一步强化九天大模型「高安全、高可控、全国产、全行业」的独特优势。 ## 历史
0%