📉 省钱细节篇 · 把账单再砍一大刀

羊毛(注册福利)+ 方法论(自部署/路由)之后,真正把账单再砍一大刀的,是这三项:选对模型、吃透缓存、用好闲时。它们不靠身份、不限次数、长期有效,而且彼此叠加。

🎯 不试错选模型 💾 缓存命中真省 🌙 夜间峰谷折扣 每项带官方链接
💡 为什么单聊这三点?因为它们不靠身份、不限次数、长期有效,而且彼此叠加。一个典型场景:用轻量模型(选对)+ 固定系统提示走缓存(命中)+ 排到夜间批量跑(闲时),三者叠满后成本可压到「旗舰模型实时调用」的 1/10 甚至 1/20

一、怎么选对模型(不试错也能选)

一个个试既浪费 token 又浪费时间,而且旗舰模型价格是轻量模型的 10–100 倍。正确做法是「先分类、再映射、让工具替你分级」,而不是靠手感盲试。

1.1 任务分类框架(4 个维度)

维度分类说明
① 难度简单 / 中等 / 复杂 / 推理分类、抽取、润色→轻量;写作、总结→主力;多步推理、复杂代码→旗舰。难度决定模型档位。
② 延迟实时 / 可异步对话、补全要快→低延迟小模型;批量处理可排夜间→更便宜的批量/闲时通道。
③ 模态文本 / 多模态纯文本用通用 LLM;图像/视频/语音用专用模型,别用旗舰文本模型硬扛多模态。
④ 成本敏感度高频 / 低频每天百万次调用→必须用小模型/缓存/闲时;偶发重任务→偶尔用旗舰也不心疼。

1.2 模型能力梯队速查

梯队代表模型适合相对价格
🏆 旗舰GPT-5 / Claude Opus / Gemini Ultra / Qwen-Max / GLM / DeepSeek-V3最难推理、长程规划、复杂代码最高(基准 1×)
🥈 主力GPT-5 mini / Claude Sonnet / Qwen-Plus / DeepSeek 标准写作、总结、Agent、客服约 0.1–0.3×
⚡ 轻量GPT-5 nano / Qwen-Turbo / Haiku / DeepSeek-V3-Lite分类、抽取、简单问答、批量预处理约 0.01–0.05×
🎯 专用Embedding / Whisper / 视觉 / TTS 模型特定模态,别用通用大模型替代按场景极低

1.3 不试错的选择法(核心)

方法① 看榜单 Benchmark 先行

先查公开榜单(综合推理、编码、中文能力),按任务类型锁定 1–2 个候选,而不是全测。省下大量试错 token。

方法② 路由工具 让网关替你分级

LiteLLM / OpenRouter / Dify 可设「按任务/价格自动选模型」规则,简单请求自动走低档。一次配置,长期生效。

方法③ 渐进法 小模型先跑

默认用轻量/主力模型,只有质量不达标才升级旗舰。90% 的请求根本用不到旗舰。这是最稳的「免试错」策略。

方法④ 映射表 固化选型

把团队常用任务列成「任务→模型」表,新人/新任务直接查表,不再每人瞎试。下面给一份可直接抄的模板。

1.4 常见任务 → 模型推荐(可直接抄的映射表)

任务类型推荐档位举例模型为何不选旗舰
文本分类 / 标签抽取轻量GPT-5 nano / Qwen-Turbo / Haiku逻辑简单,旗舰贵 20–100 倍且无质量增益
邮件/短文润色、翻译轻量–主力Qwen-Turbo / GPT-5 mini润色对「聪明度」不敏感
文档总结、会议纪要主力GPT-5 mini / Claude Sonnet / Qwen-Plus需一定理解力,但非顶级推理
客服对话、Agent 执行主力Claude Sonnet / Qwen-Plus平衡成本与稳定,高频调用压成本
复杂代码、多步推理旗舰GPT-5 / Claude Opus / Qwen-Max此处降级会明显掉质量,值得花
批量预处理后再精修轻量+旗舰两段nano 预处理 → 旗舰终判两段法比全旗舰省 70%+
📊 盘点:分层路由后整体 API 账单降 50%–90%;选错档位 = 直接多付 3–10 倍,是隐形的最大浪费源。选模型是「零成本优化」,靠分类框架 + 路由工具 + 映射表即可避免试错。

二、缓存命中(真的省,而且很可观)

缓存命中省的不止一点,是 50%–90%。原理是:模型把 prompt 前缀算过的「中间结果」存起来,下次同样的前缀直接复用,不再重新算。

2.1 三大家缓存折扣对比(2026-08 核实)

OpenAI · 自动 Prompt Caching

prompt ≥ 1024 token 自动缓存前缀,缓存输入 50%–90% off:GPT-5 家族达 90%(如 GPT-5 nano $0.05→$0.005);gpt-4o 50%。无需改代码,5–10 分钟 TTL,扩展可达 24h。

Anthropic · 显式 cache_control

标记最多 4 个缓存断点,缓存读取 0.1× 即省 90%。5 分钟 TTL(写入 1.25×)或 1 小时(写入 2×)。2 次以上命中即回本。

Google · 显式 Context Caching

建命名缓存对象复用,缓存 75% off。最小 32768 token,默认 1 小时 TTL。适合超大文档/长上下文场景。

网关层 · 整请求 网关缓存

整请求精确匹配即 100% off(完全不调 provider),TTL 可到 30 天。与厂商缓存叠加,重复 workload 可压到标价 5%–15%。

2.2 怎么让缓存真的命中(实战技巧)

顺序:不变内容放最前。顺序:系统提示 → 参考文档 → 示例 → 历史 → 用户消息。缓存只认「前缀」,把可变内容(用户问题)放最后。
固定:系统提示别加时间戳。在系统提示里塞「当前时间/随机数」会让前缀每秒变,缓存瞬间失效。时间信息放用户消息里。
RAG:文档固定作前缀。检索文档放前缀,相似问题命中同一缓存,输入成本可降 90%。
TTL:按频率选。高频(>2 次/5 分钟)用 5 分钟;低频长文档用 1 小时(Anthropic)或 24h(OpenAI 扩展)。避免频繁重写。
⚠️ 三个常见坑:① 最小阈值——OpenAI 需 ≥1024 token、Gemini 需 ≥32768 token,短提示不触发;② 写入溢价——Anthropic 写入要 1.25–2×,低频(<2 次/5 分钟)不划算;③ 跨机失效——两次请求需落同一机器,可用 prompt_cache_key 把同前缀流量路由到一起。

2.3 不同场景的节省幅度

场景缓存命中省注意
聊天机器人(长系统提示)输入降 60%–80%系统提示需 >1024 token
文档问答(同文档多问)输入降 80%–90%文档作前缀、固定不变
RAG(共享检索上下文)输入降 75%–90%相似查询命中同一缓存
Agent(固定工具 schema)输入降 40%–60%工具定义作缓存断点
分类/单次短时任务几乎不省低频+短 prompt,缓存无意义
📊 盘点:缓存是「改一行代码、长期白捡」的优化。对高频+长上下文场景,输入成本砍 75%–90%;叠网关层可再降。唯一代价是注意最小阈值和写入溢价——写对结构就稳赚。

三、夜间闲时调用(错峰省钱)

「晚间闲时」正是 2026 年国内最火的降本手段——多家平台 7 月集体上线「峰谷定价」,逻辑和电力的峰谷电价一样:夜间算力闲置,打折卖。把非实时任务排到夜间,立省 60%–80%。

3.1 国内平台夜间 / 闲时折扣汇总(2026-08 核实)

阿里云百炼 · Night Plan 22:00–08:00

Qwen 系列夜间特惠:Qwen-Max 2 折(省 80%)、Plus 4 折(省 60%)。周末节假日同样生效,模型能力不变只变计价。Token Plan 个人版可再叠加。

阿里云 Qoder · Night Qoder 22:00–08:00

全系产品(Desktop/CLI/插件)自动享:Qwen-Max 2 折、Plus 4 折,无需报名/兑换码。睡前派长任务,醒来验收。

WorkBuddy · 夜猫子计划 23:00–08:00

GLM-5.2 / Kimi-K3 等旗舰模型专属算力折扣,后台静默运行,关客户端不影响。适合批量文案、全项目重构、财报核算。

DeepSeek · 算力峰谷定价 低谷期

业界首个「算力峰谷定价」:高峰期价格翻倍、低谷期打 4 折。把批量推理排低谷时段直接省 60%。

腾讯混元 Hy3 免费 + 夜间加速

Hy3 免费调用延至 2026-08-31;每日 23:00–08:00 为「夜间加速」时段,负载低、资源充裕、不排队。高频调用推荐排夜间。

百度千帆 · 闲时训练/部署 限时活动(需确认)

曾有「闲时调度训练免费 + 推理部署资源低至 3 折」活动(历史档期,请确认当前是否有效)。微调/部署可关注官网最新闲时政策。

3.2 怎么用:把「非实时」任务全排夜间

睡前下发长任务。批量文案、代码重构、财报核算、日志排查——睡前一键派发,关电脑,云端后台跑,次日验收。
训练/微调排闲时。模型微调、Embedding 生成、大数据批处理,全排 22:00 后,吃夜间折扣或半价算力。
实时交互留白天。对话、补全、实时客服等要秒回的,仍走白天正常价;只有「能等一夜」的才排夜间。
配合 Batch API。夜间 + 批量接口(再 5 折)双重叠加,非实时 workload 成本可压到极低位。
📊 盘点:夜间闲时是「无门槛、自动生效」的省钱开关。把批量/长任务排到 22–8 点,单这一项就能省 60%–80%;和缓存、Batch 叠加后,非实时成本可砍到平时的 1/10 量级。

四、组合拳:三者叠一起

单独用已很强,叠起来才是「细节篇」的精髓。下面给一个真实可落地的极致省钱链路。

案例:10 万份文档批量摘要 + 分类

① 选对模型:分类用轻量(GPT-5 nano),摘要用主力(GPT-5 mini),不碰旗舰 → 比全旗舰省 ~90%。
② 缓存命中:固定系统提示 + 共享指令前缀,命中缓存输入 90% off → 再省一大截输入成本。
③ 夜间 + Batch:任务排到 23:00 后,走 Batch API(5 折)再叠加平台夜间折扣(省 60%–80%)→ 非实时部分成本再砍。

结果:综合成本约为「旗舰模型白天实时调用」的 1/15–1/20,且质量无损

五、总账汇总:细节能省多少

细节手段投入持续节省 / 收益适用
选对模型(分层/路由)¥0(榜单+映射表)API 账单 ↓50%–90%所有调用者
缓存命中(前缀复用)¥0(改结构/一行代码)输入成本 ↓50%–90%高频+长上下文
夜间闲时调用¥0(排期即可)非实时任务 ↓60%–80%批量/训练/长任务
三者叠加(案例)¥0综合 ≈ 原价的 1/15–1/20批量文档/数据工程
不试错选模型、写对结构吃缓存、非实时排夜间——这三件事都不花一分钱,却能把你的 AI 账单砍掉 90% 以上。选模型是地基(不浪费),缓存是放大器(复用省),闲时是时间杠杆(错峰省)。政策数字于 2026-08-10 核实,具体以各平台官网最新公告为准。
🧠 继续看长期省钱方法论 🐑 回到羊毛大全