土拨鼠日志:AI 帮你省下的 token 钱,到底省在哪
今天没修什么大东西,就把这几天攒下来的「怎么给 AI 助手省钱」的经验整理成一篇给用户看的科普。很多朋友以为大模型的账单是一个「输入多少、输出多少」的简单乘法,其实真正烧钱的往往不是你打字的那几句话。下面这四条,是我们自己天天在跟成本打交道时摸出来的。
一、最贵的常常是「闲着的那一个钟头」
大模型的上下文是无状态的:每一轮对话,系统都得把之前的全部内容重新发一遍。供应商为了省钱做了「缓存」——刚发过的东西短时间内再发,按很低的缓存价算。但缓存有有效期,通常一小时左右。
问题就出在这里:你和一个 AI 助手聊到一半,出去吃了个饭,一小时后回来接着聊。此时缓存已经过期,整段历史上下文要按正常输入价的倍数重新缓存一遍。有第三方统计过一个真实案例,光是这种「闲置后回旧会话」的重缓存,就占了总花费的四成。
所以你会看到我们一直建议:长会话别晾着,收尾时让助手把结论落成一份清单或文件,下次另起一个新会话,从「摘要 + 文件引用」启动。这不是我们偷懒,是实打实能省下一大笔。
二、你带的「工具」,每轮都在收税
AI 助手能查天气、能跑命令、能发邮件,靠的是一张「工具清单」写进每轮请求里。清单越长越贵:有工程师算过,如果挂了 40 个工具,光这份定义每轮就要多花 10~15KB 的 token——而你这一轮可能只用得上其中两个。
这也是为什么我们越来越倾向于「按需给工具」:不是把所有本事一次性挂在嘴上,而是先给一份目录,真要用哪一个,再把详细说明递过去。给助手读「文件和目录」而不是把整块资料灌进提示,实测能省大约 45% 的 token,答题准确率还更高。
我们把这些细节都写在了定价与省 Token 说明里,你能看到每一分钱大概花在哪。
三、给模型的数据,换个写法就能省一半
同样的信息,怎么写成本差很多。一条经验是,给模型传结构化的数据前先做一次语义去冗余:能枚举的改成序号、重复出现的前缀提成表头、自增的编号直接省略、布尔值写成 1/0。有实测显示,这样处理过的数据比原样 JSON 能省下约六成 token。前提是可逆、能还原——省了钱但不能把信息弄丢了,读完还得能对回原文。
另一条是「别急着换更贵的模型」。便宜的小模型先起草、贵的大模型只做一次校对,往往就够了;真正该省的,是那些「想太多」的推理过程——现在好模型的一大开销就在这儿,选型时把「推理 token 花多少」当成一等指标来看,比只比单价有用得多。
四、记忆不是越多越好,是「挑得准」最好
很多人以为 AI 助手记住的东西越多越聪明。其实一次真实会话的历史可能有几十万 token,全塞进去又慢又贵。正解是在固定的 token 预算里,挑出最相关的那几条证据——有方案把一次 48 万 token 的会话压成约 4 千 token 的工作包,省了八九成,质量却没下降。
土拨鼠就是这么干的:短期流水账、长期事实、用户偏好分层存放,用到哪层翻哪层,而不是一股脑全读进来。你在界面上看到的「节省 X%」,就是这么一轮轮省出来的真实数字,不是营销话术。
想看看这套东西整体能干什么,去 功能页 转一圈;想直接装上用,去 下载页 拿走就行,Windows 和 macOS 都有。省下来的钱,是真的能回你口袋的。
土拨鼠 Marmot