用户反馈回归:三模型对照(含耗时)

测试环境 · 用户反馈回归题 · 共 34 题 · 2026-07-25
Kimi Kimi 思考版 GLM 思考版
一句话结论

同一套环境、同一套题:GLM 思考版 33/34(97%)明显领先;普通 Kimi 25/34(74%);Kimi 思考版 24/34(71%),通过率没有因「开思考」变好,单题耗时却明显更长。差距主要在「做完后主动交给用户并收尾」,不是机器误杀。GLM 只差融资复杂填表一题:文件写好了,却没交到用户手里就停不下来。

测试集是什么

这套题不是凭空出的考题,而是把线上真实用户反馈(卡死、交不出、答非所问、技能建不完等)整理成可复跑的 34 道回归题。目标很直接:同一环境、同一题,看不同模型能不能把用户要的事做完、交到用户手里,以及大概要花多久。

怎么算过 / 怎么计时:聊天题:正常说清楚就算过。要交文件的题:用户侧能下载到结果、任务能收尾才算过。耗时按单题从开跑到结束的墙钟时间统计。

按能力分类(34 题)

能力类别题数在考验什么典型场景
33/34
GLM 思考版 · 97.1%
25/34
Kimi · 73.5%
24/34
Kimi 思考版 · 70.6%

通过率对照(%)

Kimi 开思考后,本轮通过率略降(74% → 71%),没有出现「思考就能多交几题」的红利。

完成任务耗时(中位数,秒)

全部题中位 三家都过的20题中位
公平对比看「三家都过的 20 题」:GLM 约 78 秒,Kimi 约 91 秒,Kimi 思考约 122 秒。思考版更慢,且没有换来更高通过率。

耗时多一维怎么看

通过率回答「能不能交卷」;耗时回答「交卷要等多久」。线上体验两者都重要:交得出但等半小时,用户一样不满意。

模型通过率全部题中位全部题 P90 三家都过20题中位通过题平均
GLM 思考版97.1%130s269s78s143s
Kimi73.5%115s295s91s125s
Kimi 思考版70.6%142s949s122s246s
关于 Kimi 思考版

本轮证据不支持「给 Kimi 开思考就能又稳又快」。它比普通 Kimi 更慢(同题中位大约慢三成;长尾更夸张),通过率还略低。个别技能创建题它能多过,但整体账算下来不划算。

观察说明
思考版多过的创建技能、部分空转题上,思考版比普通 Kimi 多救回几题
思考版少过的招标审查、大文件对比、翻译、继续后收尾等题上反而掉了
总账通过率没有高于普通 Kimi,但单题耗时明显更长

GLM 思考版唯一没过的题

融资填表(复杂 Excel) GLM 唯一未过

用户要的是:按融资需求说明生成分析表,并作为可下载文件交给用户。

实际发生了什么:Agent 其实已经写出了分析表文件,但没有主动呈现给用户、也没有结束任务,而是继续在「建表 / 导入」上打转,最后被系统因步骤过多强制打断。同题上两家 Kimi 里普通版交成功了。

用人话说:

活干了大半,文件也有了,但没把东西递到用户手里就停不下来。


后续怎么改

· 发现「文件已经写好了却还在空转」时,系统自动帮它交卷并收尾

· 对反复改同一文件、没有新进展的行为早停并提醒换思路

· 复杂填表任务先交一版能用的最小结果,再迭代完善


差距主要差在哪

平台这边:环境稳了,长任务也不再被误杀,问不清时也能续聊。真正拉开分数的,是模型会不会把「交给用户」当成做完的标准;拉开等待时间的,是会不会少空转、少瞎重做。

听懂 → 做到 → 交卷 GLM 更稳也更快

更常把「要有可下载结果、并明确交给用户」当作硬要求;同题中位耗时也最短。

招标审查、新闻自动化、经营分析、建技能这类题上更明显。

半途停 · 写错地方 · 有文件却不交 Kimi 更常栽在这

常见三种:中间步骤做完没有最终文件;文件写到用户拿不到的目录;文件其实已经有了,却反复修改停不下来。

开思考后,部分题想得更久,但不等于交得更好。

GLM 明显更强的场景(摘)

场景两家 Kimi 大概卡在哪
招标审查两家 Kimi 都更容易停在半路,交不出审查意见文件
自动化新闻Kimi 停在配置排查,没有产出结果文件
空转 / 长跑文件其实已有,却反复改到被系统强制打断
经营分析读样例缺页后放弃,没有最终交付
澄清场景需要用户补充信息时走不通;GLM 能交卷

建议

已经稳住的

长任务不再被误杀;服务本轮稳定;需要用户补充信息时也能续上。

生产默认优先用更会「做完就交卷」且不拖时间的模型(本轮证据支持 GLM 思考版)。Kimi 思考版不宜作为「靠开思考提升交付」的默认选项。

平台继续补「半成品自动交卷、写错路径纠偏、空转早停」:既抬通过率,也削长尾等待。

数据来自同日同环境对照跑批 · Kimi / Kimi 思考版 / GLM 思考版 · 2026-07-25