同一套环境、同一套题:GLM 思考版 33/34(97%)明显领先;普通 Kimi 25/34(74%);Kimi 思考版 24/34(71%),通过率没有因「开思考」变好,单题耗时却明显更长。差距主要在「做完后主动交给用户并收尾」,不是机器误杀。GLM 只差融资复杂填表一题:文件写好了,却没交到用户手里就停不下来。
这套题不是凭空出的考题,而是把线上真实用户反馈(卡死、交不出、答非所问、技能建不完等)整理成可复跑的 34 道回归题。目标很直接:同一环境、同一题,看不同模型能不能把用户要的事做完、交到用户手里,以及大概要花多久。
怎么算过 / 怎么计时:聊天题:正常说清楚就算过。要交文件的题:用户侧能下载到结果、任务能收尾才算过。耗时按单题从开跑到结束的墙钟时间统计。
| 能力类别 | 题数 | 在考验什么 | 典型场景 |
|---|
通过率回答「能不能交卷」;耗时回答「交卷要等多久」。线上体验两者都重要:交得出但等半小时,用户一样不满意。
| 模型 | 通过率 | 全部题中位 | 全部题 P90 | 三家都过20题中位 | 通过题平均 |
|---|---|---|---|---|---|
| GLM 思考版 | 97.1% | 130s | 269s | 78s | 143s |
| Kimi | 73.5% | 115s | 295s | 91s | 125s |
| Kimi 思考版 | 70.6% | 142s | 949s | 122s | 246s |
本轮证据不支持「给 Kimi 开思考就能又稳又快」。它比普通 Kimi 更慢(同题中位大约慢三成;长尾更夸张),通过率还略低。个别技能创建题它能多过,但整体账算下来不划算。
| 观察 | 说明 |
|---|---|
| 思考版多过的 | 创建技能、部分空转题上,思考版比普通 Kimi 多救回几题 |
| 思考版少过的 | 招标审查、大文件对比、翻译、继续后收尾等题上反而掉了 |
| 总账 | 通过率没有高于普通 Kimi,但单题耗时明显更长 |
用户要的是:按融资需求说明生成分析表,并作为可下载文件交给用户。
实际发生了什么:Agent 其实已经写出了分析表文件,但没有主动呈现给用户、也没有结束任务,而是继续在「建表 / 导入」上打转,最后被系统因步骤过多强制打断。同题上两家 Kimi 里普通版交成功了。
用人话说:
活干了大半,文件也有了,但没把东西递到用户手里就停不下来。
后续怎么改
· 发现「文件已经写好了却还在空转」时,系统自动帮它交卷并收尾
· 对反复改同一文件、没有新进展的行为早停并提醒换思路
· 复杂填表任务先交一版能用的最小结果,再迭代完善
平台这边:环境稳了,长任务也不再被误杀,问不清时也能续聊。真正拉开分数的,是模型会不会把「交给用户」当成做完的标准;拉开等待时间的,是会不会少空转、少瞎重做。
更常把「要有可下载结果、并明确交给用户」当作硬要求;同题中位耗时也最短。
招标审查、新闻自动化、经营分析、建技能这类题上更明显。
常见三种:中间步骤做完没有最终文件;文件写到用户拿不到的目录;文件其实已经有了,却反复修改停不下来。
开思考后,部分题想得更久,但不等于交得更好。
| 场景 | 两家 Kimi 大概卡在哪 |
|---|---|
| 招标审查 | 两家 Kimi 都更容易停在半路,交不出审查意见文件 |
| 自动化新闻 | Kimi 停在配置排查,没有产出结果文件 |
| 空转 / 长跑 | 文件其实已有,却反复改到被系统强制打断 |
| 经营分析 | 读样例缺页后放弃,没有最终交付 |
| 澄清场景 | 需要用户补充信息时走不通;GLM 能交卷 |
长任务不再被误杀;服务本轮稳定;需要用户补充信息时也能续上。
生产默认优先用更会「做完就交卷」且不拖时间的模型(本轮证据支持 GLM 思考版)。Kimi 思考版不宜作为「靠开思考提升交付」的默认选项。
平台继续补「半成品自动交卷、写错路径纠偏、空转早停」:既抬通过率,也削长尾等待。
数据来自同日同环境对照跑批 · Kimi / Kimi 思考版 / GLM 思考版 · 2026-07-25