文章目录前言1. 问了个幼儿园题它回了我一篇论文1.1 你为思考付了钱但没人告诉你1.2 一行参数世界清净了1.3 最离谱的是默认值2. 先认识一下这位话多的主角3. 纸面价格 vs 实测账单3.1 纸面价格是相亲照3.2 实测差距只有 2.3 倍4. 钱都花哪了内心戏4.1 七成以上的 token 是想出来的4.2 最长的一条15006 个 token5. enable_thinking同一个开关三种演法5.1 在 Flash 上关了但没完全关5.2 在 Kimi 和 Qwen 上一个真省一个真烧6. 真正的旋钮reasoning_effort6.1 默认就是 max6.2 low 是什么效果7. 省钱要还吗要但只坑难题7.1 准确率100%、98%、92%7.2 最搞笑的是那个 0.61228. 输出格式比思考参数还狠9. 实操建议抄作业版10. 怎么测出来的速览11. 这次踩过的坑12. 结尾P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看 传送门https://blog.csdn.net/H1727548前言如果我问你 SSH 默认端口是多少正常人会回答22。GLM-5.3-Flash 不一样。它吭哧吭哧吐了 625 个 token绕了不知道多少个弯最后才在结尾郑重其事地交出两个字22。这感觉就像你问路对方先给你科普了半小时城市交通史最后说右转。更扎心的是这个 625 还是中位数。也就是说有一半的场合它比这还能扯。同一个问题Qwen3.8-Max 只用了 156 个 token。625 对 156差的这 469 个 token 去哪了答案是被你付钱了。1. 问了个幼儿园题它回了我一篇论文1.1 你为思考付了钱但没人告诉你事情是这样的我们本来只想测测这几个模型谁更划算结果发现纸面价格便宜的模型账单上未必便宜。罪魁祸首是输出 token 数。模型按 token 收费但价格页面永远不会告诉你它为了一个答案会在心里先演多少出戏。1.2 一行参数世界清净了解法只有一个参数请求里加一句reasoning_effort: low同一个问题直接从 625 个 token 缩到 155 个。相当于你终于忍无可忍地对它说别演了报答案。它立刻从相声演员切换成自动回复。1.3 最离谱的是默认值你知道更离谱的是什么吗这个参数你不传默认就是 max——也就是最贵的那一档。这跟饭店不问你意见直接上最贵的菜有什么区别区别是饭店至少会问一句要不要。模型连问都不问。只加这一个参数什么都不改整套测试下来便宜了 6.3 倍。2. 先认识一下这位话多的主角GLM-5.3-Flash总参数 3200 亿每个 token 只激活 180 亿MIT 开源。作为对比Qwen3.8-Max 是 2.4 万亿参数、每 token 激活 950 亿。Flash 激活量只有人家的五分之一但在 Artificial Analysis 的 Intelligence Index 上得分跟 Kimi K3 Max 几乎一样。翻译成人话它用更少的力气干了差不多的活所以单 token 价格可以定得很便宜。便宜到什么程度输入 0.15 美元/百万 tokenKimi 是 3 美元。20 倍差价0.15 美元大概能买 0.0001 个煎饼果子。然后它就在输出上把面子找回来了——话多。3. 纸面价格 vs 实测账单3.1 纸面价格是相亲照先看官方价格表模型输入美元/百万 token输出美元/百万 token缓存输入glm-5.3-flash0.150.500.03qwen3.8-max2.006.000.20kimi-k33.0015.000.30Flash 输出单价只有 Qwen 的十二分之一、Kimi 的三十分之一。看着是不是很心动别急。我们实测了 2700 次 API 调用总共花了 14.75 美元。3.2 实测差距只有 2.3 倍默认配置下Flash 相对 Qwen 的真实成本优势只有 2.3 倍不是 12 倍相对 Kimi 是 17 倍不是 30 倍。纸面价格是相亲照实测账单是素颜。不是它骗你是它没告诉你它话多。单 token 便宜 12 倍但话多 5 倍——相当于奶茶买一送一结果你一个人喝了五杯。便宜是真便宜账单也是真账单。Kimi 缩水得少30 倍变 17 倍。Qwen 缩水最多12 倍直接变 2.3 倍。这种不对称就是线索。4. 钱都花哪了内心戏4.1 七成以上的 token 是想出来的Flash 和 Kimi 会把推理过程单独放进reasoning_content字段于是我们直接统计了。简单问题上Flash 输出 token 里 72% 是推理难题上这个比例飙到 84%。翻译一下你请的不是模型是一个上班时间 80% 都在写日记的员工。日记不是给你看的。但账单是给你的。4.2 最长的一条15006 个 token尾巴比中位数更夸张。Flash 平均输出 3111 token中位数只有 1409变异系数超过 1——通俗点说它输出多长全看心情。我们记录到最长的一条回复15006 个 token其中 94.7% 是推理。它回答的是一个部署架构问题。15006 个 token 什么概念比很多技术文章的全文还长。我一度想建议它去写小说书名我都想好了《论部署拓扑的内心独白》。这一条单独花了 0.00753 美元是 Flash 平均单次成本的 4.8 倍。这也是为什么全文用中位数不用平均值——平均值在这个场景里不是更好看是纯误导。5. enable_thinking同一个开关三种演法网上很多文章把enable_thinking当成关掉思考模式的万能开关我们一开始也这么干。结果同一个参数三个模型演出了三个剧本。5.1 在 Flash 上关了但没完全关把enable_thinking设为 falseFlash 的reasoning_content字段确实空了。但输出 token 反而涨了 20.9%成本涨了 11.1%。推理没停只是从后台搬到了前台。相当于你让它别写日记了它改开直播了。我们在 120 条回复里的 103 条中都检测到了残留在答案里的思维链。比如回答TTFT 是什么缩写这种送分题它开头是The user is asking about TTFT in the context of LLM inference… Let me think about what I know about TTFT:你问它 TTFT它先让我想想我知道什么。兄弟这一句思考也是按 token 收费的。5.2 在 Kimi 和 Qwen 上一个真省一个真烧同样的参数在 Kimi 上输出 token 降 67.9%成本降 75.5%。真·省电模式。在 Qwen 上更刺激思考模式默认就是关的你把它打开输出 token 涨 429%成本涨 508%。有的开关是省电模式有的开关是电暖器。同样是关在 A 模型上是省钱按钮在 B 模型上是花钱按钮。6. 真正的旋钮reasoning_effort6.1 默认就是 maxModel Card 写得很清楚reasoning_effort可设 low、high、max不传默认 max。我们把同样的 24 个问题三个等级全跑了一遍设置输出 token 中位数单次请求成本相比默认配置未设置默认14090.001564 美元1.00 倍reasoning_effort: max14340.001526 美元0.98 倍reasoning_effort: high5800.000384 美元0.25 倍reasoning_effort: low4140.000250 美元0.16 倍默认和显式 max 的配对比值是 0.984——基本实锤每个没配置的请求都跑在最贵的档位。6.2 low 是什么效果fromopenaiimportOpenAI clientOpenAI(base_urlhttps://inference.do-ai.run/v1)respclient.chat.completions.create(modelglm-5.3-flash,messages[{role:user,content:SSH 默认端口是多少}],extra_body{reasoning_effort:low},)print(resp.choices[0].message.content)# 22low 相比默认便宜 84%也就是 6.3 倍。而且它不是均匀压缩它会自己看菜下饭简单问题上推理占比从 72% 掉到 3%难题上仍保留 40%。简单说它不是把脑子砍了只是告诉它做选择题的时候别写 500 字小作文。顺带一提Model Card 推荐的clear_thinking: true我们也测了几乎没变化。这个参数属于氛围组——负责让你感觉自己优化了其实没有。7. 省钱要还吗要但只坑难题7.1 准确率100%、98%、92%听到省 84%你可能想问便宜没好货于是我们又跑了 20 个有确定答案的任务共 1099 条可评分回复。默认配置100%。high98%。low92%。注意错误分布全部发生在难题上简单题三个档位都是满分。7.2 最搞笑的是那个 0.6122low 模式下一道多步成本建模题 5 次错了 3 次其中两次把正确答案 61.22 写成了 0.6122。这不是不会算是单位丢了。就像发工资 61.22 万你记成了 6122 块。省下来的钱差点被单位吃掉。不过 8% 的失败率换 84% 的成本下降简单任务上依然划算。但别急着推广到复杂任务——这套测试集我们自己都觉得太简单了。8. 输出格式比思考参数还狠测试里有个意外发现开放式问题的输出中位数Flash 是 1409一旦强制结构化输出直接掉到 276降了 80.4%。你给它一张答题卡它就不再写散文了。原来它不是不会短是没人告诉它可以短。这让 Flash 相对 Qwen 的成本优势从 2.3 倍直接回到 12.8 倍基本兑现了纸面价格。更绝的是 “Answer in one sentence.”——就这一句三个模型输出降了 70% 到 91%。但推理占比纹丝不动。压缩的是正文日记照写不误。你省的是总账单内心戏该多少钱还是多少钱。9. 实操建议抄作业版以下建议全部来自 14.75 美元的实测不谢。省下来的钱记得请自己喝奶茶。在 Flash 上永远显式设置reasoning_effort。不设就是 max就是最贵。这是整个测试里影响最大的省钱手段。分类、信息提取、简单查询这类活直接用 low。没掉准确率便宜 6.3 倍。混合负载选 high 当默认便宜 4 倍准确率 98%。真正的多步推理难题老实保持 max。省钱的账难题上会还的。预算按实际 token 估别按单价估。单价是菜单上的价格token 是上桌后的分量。先跑 100 次真实请求再说。Kimi 用户可试enable_thinking: false省 75%准确率掉 2 个点。Qwen 用户想开思考模式先想清楚那会让成本涨约 5 倍。别在 Flash 上指望enable_thinking: false省钱它反而贵 11%。这就像为了省油把车推着走。10. 怎么测出来的速览API 端点https://inference.do-ai.run/v1兼容 OpenAI模型 ID 分别是 glm-5.3-flash、qwen3.8-max、kimi-k3。没发任何采样参数——Kimi 用的是固定参数我们要是只给另外俩模型设 temperature就得再写三千字解释这种不对称。省省吧。非流式max_tokens 拉到 32000。早期用 8000 时Flash 的难题回复 20% 被截断——token 预算用完了它还在想。执行顺序用固定 seed 随机化免得平台的性能波动只坑最后一个倒霉蛋。推理 token 用各模型自己的 tokenizer 本地统计再和计费 token 对齐固定偏移量Flash 2Qwen 1Kimi 13。偏移稳定说明统计没毛病。为什么用中位数不用平均值因为平均值会说谎。你和马斯克平均一下也是亿万富翁中位数才会告诉你你是个打工人。11. 这次踩过的坑一开始调错了参数。我们先用enable_thinking折腾了半天重读 Model Card 才发现正主是reasoning_effort。找钥匙先翻了客厅最后发现钥匙在裤兜里。我们的参考答案有一道题还写错了。延迟预算题45 条回复全答 43答案 key 写的是 42。查完发现模型是对的——第一个 token 在 TTFT 就到了。这段建议截屏AI 赢人类的证据确凿。2700 次调用失败了 1 次HTTP 429重试 5 次都没救回来。1/2700 的失败率比我们项目上线的成功率还高。297 条记录命中 prompt cache每次都恰好缓存 128 token。输入成本占比太小就没管它。12. 结尾整个测试花了 14.75 美元大概两杯奶茶的钱。换来的核心结论一句话模型按 token 收费但没人告诉你它会说多少 token。省钱的钥匙不在单价上在一个叫reasoning_effort的参数里。记得显式设置别信默认值——默认值是用来让账单变大的不是用来省钱的。祝你的输出和你的账单一样短。P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/H1727548
