導入 AI 後最常見的「驚嚇時刻」是月底看到 30 萬帳單。原因通常是:用最強的模型處理所有任務、Prompt 太長、重複問同樣問題、批次任務沒整合、串流模式吃 token。本文整理 5 個經過 山葵組 AI 服務 多次驗證的實戰技巧,幫你把成本壓低 50–70%。
不是所有任務都需要 GPT-5 / Claude Opus。建立分層:簡單任務(分類、摘要、提取)走 Haiku / GPT-5 mini(成本 1/30),中度任務走 Sonnet(成本 1/5),高難度推理才用 Opus。實作上用一個小模型先判斷任務複雜度,再 routing。許多企業光靠這招就能省 60%。
長 Prompt = 長帳單。常見肥肉:重複的指令、過多範例、把整份文件貼進去。優化做法:把固定指令做成 System Prompt 並用 Prompt Caching(Anthropic、OpenAI 都有支援,可省 90% 重複部分)。範例只給最關鍵的 1–2 個。文件用 RAG 取最相關的 3–5 段而非全文。
客服常見問題、產品介紹、條款說明這類「答案幾乎不變」的查詢,第一次問 AI 後答案存進 Redis 或向量資料庫,下次同類問題直接回。Hit rate 30–50% 很常見,等於省下這部分的 LLM 呼叫。注意要設過期時間並支援人工覆蓋。
OpenAI 與 Anthropic 都提供 Batch API:非即時任務(夜間報表、大量分類、文件摘要)打包提交,24 小時內回傳,價格直接打 5 折。適合對時效不敏感的後台任務。把「能離線」的流程都搬到 Batch,可省 30–40%。
內部任務(員工問答、內部知識)不需 GPT-5 的能力,用 Llama 3.1 / Qwen 2.5(70B 量化版)跑在自家 GPU 上,成本只剩雲端 API 的 10–20%。對外、面對客戶的高品質場景仍可用 Cloud LLM。詳細評估可見 山葵組部落格 的私有部署 LLM 完整指南。
串流回應雖然體驗好,但每個 chunk 都會收費 metadata。對 API 整合場景建議關閉串流。同時嚴格限制 max_tokens——AI 會「能寫多少寫多少」,明確上限能省 20–40% 輸出 token。Function Calling 比讓 AI 寫長文字回 JSON 還便宜。
建立每日 Dashboard:每個模型的 tokens 使用量、成本、平均延遲、錯誤率。LangSmith、Langfuse、Helicone 都能做。每週 review 哪些 endpoint 最燒錢,針對最大的 3 個下手優化,效率最高。
LLM 成本優化不是一次調整完就結束,而是每月持續迭代。山葵組 AI 服務 建議企業把 AI 帳單監控納入 LLMOps 流程,當帳單成長超過業績成長時就要啟動優化。想討論你的 AI 成本架構?歡迎到 山葵組 AI 服務 或 聯絡山葵組。成本成本企業