一、开源自部署:模型跑在自己机器上
最核心的一招——不调任何付费 API,直接把开源大模型下载到本地 / 自有服务器运行。适合有显卡(或 Mac)的用户,推理成本几乎只剩电费。
Ollama 本地推理 · 一键启动
一条命令跑 Qwen、Llama、DeepSeek、Phi 等数百种开源模型。完全免费开源,支持 Mac / Linux / Windows。零 API 费用。
llama.cpp / MLX 量化推理引擎
llama.cpp 用 4bit/8bit 量化在普通 CPU/显卡跑大模型;MLX 是苹果芯片原生框架,Mac 上 7B~32B 模型丝滑本地跑。开源免费。
vLLM 高吞吐服务
把本地模型封装成 OpenAI 兼容 API 服务,吞吐高、显存利用好。适合团队/小公司自建内部推理网关,开源免费替代付费 API。
Qwen / DeepSeek / Llama / Phi 推荐模型
Qwen2.5/3、DeepSeek-R1-Distill、Llama-3.x、Phi-4 等可在本地流畅运行。32B 以下量化版单张 24G 显卡即可,模型权重免费下载。
📊 盘点:零持续费用 + 一次性硬件 ¥0(Mac)/ ¥8k–2w(独显);换来「无限量、隐私不出本机、断网可用」的长期推理能力,是压住长期成本的地基。以月调用 1 亿 token 的 4o 级任务为例,云 API 约 ¥90+;本地部署边际成本≈电费,月省 90%+ 且无限量。
二、模型路由与分层调用
同一句话没必要都扔给最贵的大模型。用网关把「简单活」分给小模型、「难活」才升级大模型,整体 API 成本可降 50%–90%。
LiteLLM 统一网关 + 成本追踪
一个库接入 100+ 模型(OpenAI/Claude/Gemini/本地),支持 fallback、负载均衡、按模型计费统计。自建路由逻辑首选,开源免费。
OpenRouter 聚合 API 市场
一个 key 调数百模型,常比官方便宜,且自动按「最便宜可用模型」路由。新用户有免费额度,注册即用,按量计费无月费。
Dify 可视化编排
开源 LLMOps 平台,可视化搭工作流并指定每步用哪个模型(便宜模型做预处理、强模型做终判)。自托管免费,也能接本地 Ollama。
📊 盘点:工具本身 0 成本(开源/免费层);价值在于「把贵的用量压下来」。若 80% 请求可用小模型承接,相比全用旗舰模型成本降约 90%。
三、调用 & Prompt 优化(省 token = 省真金白银)
不改模型、不换平台,光把「怎么调」做对,就能砍掉一大块账单。以下均为官方原生能力,2026-08 核实仍有效。
Prompt Caching 缓存复用 · 官方原生
Anthropic 缓存读取价为标准输入的 0.1 倍(约省 90%);OpenAI 缓存输入 5 折。适合固定系统提示词、长文档问答、RAG 共享上下文。
Batch API 异步批处理 · 5 折
OpenAI / Anthropic / Google 的批量接口统一 5 折,接受 24 小时内返回。文档分类、批量摘要、Embedding、数据 enrichment 等非实时任务首选。
上下文瘦身 压缩 / 摘要 / 截断
把长对话历史先做摘要再回传;只截取文档相关段落;多用 few-shot 精选样例。把平均 prompt 从 2000 token 压到 1200,输入成本直降 40%。
设 max_tokens 上限 防爆输出
输出 token 通常比输入贵 3–4 倍。分类设 10、问答设 256、摘要设 512,避免单次冗长回复薅走预算。零成本防御。
旗舰 → 轻量模型 小模型替代
GPT-5 nano 比 GPT-5 便宜约 96%;多数润色/抽取用 mini/nano 质量无损。把「非推理」任务全量降级即可。
📊 盘点:纯技术优化,零成本投入;是「已经决定用付费 API」时性价比最高的一刀。Batch(5折) + Caching(90% off 缓存段) + 小模型,实战可把实时调用成本砍掉 90%–95%。
四、免费算力资源(长期免费,不是羊毛)
这些不是「新用户一次性福利」,而是长期存在、无需绑卡、可反复用的免费 GPU / 推理额度,适合训练、微调、跑实验、做推理评测。
Google Colab 免费版 免费 GPU 笔记本
免费 T4(16G),每周 15–30 GPU 小时,单会话最长 12 小时,无需绑卡。学习、原型、小训练首选。
Kaggle Notebooks 免费 GPU 笔记本
每周 30 GPU 小时(T4/P100),9 小时会话,稳定性好、无需排队。数据竞赛 / 实验神器。
Lightning AI 免费云 IDE
PyTorch 团队出品,每月 80 免费 GPU 小时(T4 起,可到 H200),代码持久化、VS Code 体验。开发者最友好。
Groq / Cerebras / AI Studio 免费推理 API
Groq、Cerebras 提供极速开源模型免费推理;Google AI Studio 的 Gemini 有永久免费层。做应用原型、评测零成本。
Hugging Face ZeroGPU 免费托管推理
HF Spaces 提供免费共享 GPU(最高 H200 级),可托管模型和 Demo,无需绑卡。开源项目展示首选。
📊 盘点:持续免费、无需新人身份;周均 ~45–60 免费 GPU 小时 + 多个免费推理 API(等值月租金约 ¥200–400),足以覆盖学习、实验、原型阶段,几乎零现金支出。
五、开源工具替代付费 SaaS
很多付费 AI 工具(绘图、转写、知识库、编程助手)都有功能对齐的开源替代品。自有算力跑起来,月费直接归零。
ComfyUI / SD WebUI 图像生成
本地跑 SD / Flux / 各类开源画模,替代 Midjourney(¥80–¥300/月)。开源免费,出图不受限、可商用(看模型许可)。
Whisper 本地部署 语音转写
OpenAI 开源的 Whisper 本地转写,替代各类付费字幕/转写 SaaS。完全免费,隐私不出本机,批量处理无时长费。
Dify / FastGPT / AnythingLLM RAG / 知识库
自建知识库、智能体、RAG 问答,替代商业知识库 SaaS。接本地模型即 0 边际成本,数据自己掌控。
Continue / CodeGeeX 编程助手
Continue(IDE 插件,可接本地模型)和 CodeGeeX 替代付费 GitHub Copilot(¥70–¥100/月)。开源/免费,断网也能用。
| 被替代的付费项 | 替代后月费 | 原月费参考 |
| Midjourney / 绘图 SaaS | ¥0(自有显卡电费) | ¥80–¥300 |
| 付费转写 / 字幕工具 | ¥0 | ¥30–¥200 |
| 商业知识库 / RAG SaaS | ¥0(本地模型) | ¥100–¥1000+ |
| GitHub Copilot 付费版 | ¥0(Continue/CodeGeeX) | ≈¥70–¥100 |
📊 盘点:以「自有算力」换「零订阅费」。一个典型创作者把绘图+转写+知识库+编程助手全换开源,月省 ¥300–¥1600,仅牺牲一点本地硬件投入。
六、订阅省钱技巧(花钱也花得聪明)
真要订阅付费产品时,用对姿势也能省不少。以下均为 2026-08 仍在位的公开政策。
年付优于月付。ChatGPT Team 年付 $25/人/月 vs 月付 $30/人/月,10 人团队年付省 $600/年。多数 SaaS 年付≈省 2 个月。
🔗 ChatGPT 定价
Team 版代替多人 Plus。ChatGPT Team 数据默认不用于训练、有管理后台。多人协作时比「每人单独 Plus」更便宜且更合规。
学生 / 教育优惠。GitHub Student Pack 给学生免费 Copilot + 多家云 credits;多款 AI 工具对学生免费或打折。学生党务必先用身份。
🔗 GitHub Student Pack
Free 层先用满。Gemini 永久免费层、ChatGPT Free、Claude Free 覆盖日常轻量需求。把付费额度留给真正需要旗舰模型的重活。
🔗 Gemini 免费层
支付优化。用有境外返现的卡订阅美元产品,留意双币/全币种卡免货币转换费。长期订阅积少成多。
试用期 & 避免重复。付费试用设日历提醒及时取消;评估是否真需「Plus + Claude Pro」双开,偏重其一往往更省。
📊 盘点:纯「花得聪明」。年付+学生身份+去重,典型个人用户年省 ¥1000–¥3000;团队用户更可观。
七、硬件投入:一次性买卡 vs 长期云成本
当你每月云 GPU / API 账单开始稳定且可观,买一张显卡可能比一直租云更划算。算一笔回本账。
RTX 4090 / 5090(24G)本地显卡
可跑 32B 量化模型做日常推理,或 7B–14B 全精度微调。云上同档 A100/H100 约 $1–3/小时,本地 0 时长费。
Mac + MLX 苹果用户
Apple Silicon 统一内存(如 64G/128G Mac)可直接跑 30B+ 模型,0 额外硬件投入,静音低功耗,适合个人长期用。
二手卡 / spot 实例 省钱策略
二手 3090/4090 进一步降本;免费额度用尽后再切 spot 实例(比按需便宜 60%–90%),过渡平滑。
📊 盘点:适合「用量已经稳定且大」的用户。回本线约在月云 GPU 支出 ¥800+ 时;轻度用户用免费算力(第四节)更划算,不必买卡。
八、组合拳:真实零成本 / 低成本方案
把前面几招叠起来,就是能落地的「几乎不花钱用 AI」组合。每个方案都可在羊毛篇的免费额度用尽后无缝接力。
① 个人开发者(写代码 / 调 API)
本地 Ollama 跑 Qwen 做日常 + LiteLLM 路由把重活丢 Claude/Gemini 免费层 + Batch/Caching 压付费段。
结果:日常 ¥0,仅偶发重任务花几块钱
② 自媒体 / 文案批量生产
ComfyUI 本地出图(替代 MJ)+ Whisper 本地转写(替代付费字幕)+ Dify 本地知识库写稿。
结果:绘图/转写/知识库月费全免,仅显卡电费
③ 小微企业低成本商用
自托管 vLLM+Ollama 内部推理网关 + 羊毛篇企业额度(阿里百炼 7000 万 / 模力工场 1000 万)+ 付费段用 Batch 5 折。
结果:把商用 API 账单压到原来的 1/3–1/5
④ 学生 / 毕业设计
GitHub Student Pack(免费 Copilot + 云 credits)+ Colab/Kaggle 免费 GPU + 羊毛篇校园额度(阿里云高校 3000 万 / 智谱校园 3000 万 / 国家超算 6000 万)。
结果:毕业设计周期基本零现金支出
九、总账汇总:用方法论能省多少
| 省钱手段 | 投入 | 持续节省 / 收益 | 适用人群 |
| 开源自部署(Ollama/MLX) | ¥0(Mac)/ ¥8k–2w(显卡) | 推理费≈¥0,无限量 | 有显卡/Mac 者 |
| 模型路由分层(LiteLLM 等) | ¥0 | API 账单 ↓50%–90% | 所有 API 调用者 |
| 调用/Prompt 优化 | ¥0(代码改动) | 成本再砍 90%–95% | 付费 API 用户 |
| 免费算力(Colab/Kaggle 等) | ¥0、无需绑卡 | ≈¥200–400/月等值 | 学习/实验/原型 |
| 开源替代付费 SaaS | 自有算力电费 | 月省 ¥300–1600 | 创作者/团队 |
| 订阅省钱技巧 | 正常订阅费 | 年省 ¥1000–3000 | 所有订阅用户 |
| 硬件一次性买卡 | ¥8k–2w | 1–2 年回本后近乎免费 | 重度稳定用户 |
羊毛是门票,方法论是复利。先用注册福利把门槛压到 0,再用本篇把长期账单锁死在低位——这就是「AI 省钱攻略」的完整打法。政策数字于 2026-08-10 核实(Batch 5 折、Claude 缓存读取 0.1×、ChatGPT Team 年付 $25/人/月等),具体以各平台官网最新公告为准。