很多人第一次看到API账单的时候,表情大概是这样的:
几百块?我就问了一个问题?
没错,AI公司不是按"问题"收费的,是按Token收的。但这个Token到底是什么,为什么有的回答贵得离谱,有的问题便宜到可以忽略不计?
今天把这个事情彻底讲清楚。
Token不是字
你可能听说过大模型用Token做计算。但这里的坑很多。
首先,Token不是字符。一个中文汉字在不同模型里可能是1个Token,也可能是2个甚至更多。英文更复杂,"a"是一个Token,"ABCD"可能也是4个Token。
OpenAI做过一个实验:英语里平均4个字符等于1个Token。换句话说,你写1000个字,大概消耗250个Token——理论上很便宜。
但为什么你的账单经常高得吓人?
因为Token的计算是双向的。你发一段文字给GPT,消耗一次输入Token;它回复一段文字,又消耗一次输出Token。调用一次API,其实收了你两次费。
Token为什么按字数算这么贵?
我们来算一笔账。
GPT‑4o 的输入收费是 2.5 美元 / 百万 Token,输出收费是 10 美元 / 百万 Token。中文比较费 Token,大约 1 百万 Token ≈ 75 万汉字。
也就是说,你发送 1000 字给 GPT,输入费用大约 0.02–0.03 元人民币。
而 GPT 回复 1000 字,输出费用大约 0.09–0.10 元人民币。
这听起来也不贵。但问题在于,大模型的一个回答经常是500字起步。真正贵的是输出部分的累计计费。
很多人以为"我就问了两个问题",但实际上大模型在回答第一个问题时"想到了"更多内容,这些思考过程也要算Token。这就是为什么看似简单的对话,账单可能突然爆炸。
上下文窗口:被忽视的计费黑洞
现在我要说的这个点,大部分人都不知道。
当你给AI一大段背景信息,然后问一个问题的时候,整个上下文都在算Token。
比如你给GPT发送了一篇1万字的文章,问它"文章的核心观点是什么"。这时候计费的不是"你问的那句话",而是:
输入:你的1万字背景 + 你的问题
输出:它的回答
有人测过,Claude处理10万Token的上下文,费用是单纯处理1万Token的10倍。但用户感知到的是"我问了一个问题"。
这也是为什么各大厂商在拼命优化上下文窗口——不是技术秀,而是谁能让上下文更便宜,谁就能留住开发者。
Token计费的天坑:思维链
还有一个更隐蔽的问题:推理模型。
很多人以为DeepSeek、o3这类推理模型更省钱,因为它们"思考过程不上报"。但实际情况更复杂。
这类模型的输出Token数量远超普通模型。因为它们的思考过程本身也是输出的一部分。一个数学问题,推理模型可能输出2000Token的思考过程,然后再输出500Token的最终答案。
你的直观感受是"它想了很久",实际上是你的Token消耗也在翻倍。
所以有时候你选了一个"更聪明"的模型,但账单反而更贵。这种反差让很多人摸不着头脑。
怎么控制成本?
知道了计费规则,成本控制就有方向了。
第一,控制输入。不要把整个文档丢给AI,能总结的先总结,能抽要点的先抽要点。很多时候100字的核心描述比5000字的全量输入效果好,成本还更低。
第二,控制输出。告诉模型"你只需要回复一句话"。很多人没意识到,AI默认会给你一个完整段落,但你可以改变这个行为。
第三,缓存复用。相同的系统提示词、相同的模板内容,可以放在服务端缓存起来,避免每次调用都重新传输。
实际上,现在很多成熟的应用已经在这样做了。Claude和OpenAI都提供上下文缓存功能,虽然不是免费的,但比重复传输便宜得多。
最后说一个感受
很多人觉得AI贵,本质上是因为不理解它的计费逻辑。
Token不是字数,但也不是什么神秘的东西。它就是一种按量计费的单位,就像电费按度收、水费按吨算一样。
搞清楚这个,你就不会再被账单吓到。
你觉得现在的AI定价合理吗?贵了还是便宜了?
本文链接:https://blog.lahong.top/post/115.html 本文及相关素材著作权归原作者所有,未经书面授权禁止擅自转载、摘抄、改编及商业使用,违者将追究法律责任



