當客戶資料、合約、財報、法律文件都要餵給 AI 處理時,「資料是不是會被 OpenAI 拿去訓練?」就成了 IT 與法務的最大顧慮。私有部署 LLM 把模型放在自家機房或私有雲,資料不出企業邊界,是金融、醫療、政府、製造業最常選的方案。山葵組 AI 服務 已協助多家企業評估與導入私有 LLM 架構。
2026 年企業最常使用的有四大家族:Meta 的 Llama 3 / 3.1(70B、405B)、阿里 Qwen 2.5(14B、72B)、Mistral(含 Mixtral 8x22B MoE)、Google Gemma 2。中文應用建議先試 Qwen,英文重推理選 Llama,混合場景考慮 Mistral。模型授權需注意 Llama 商用條款與 Qwen 的免費商用範圍。
跑 7B 模型可用單張 RTX 4090 或 L4;跑 70B 量化版需要 2 張 A100(80GB)或 4 張 RTX A6000;跑 405B 則需 8 張 H100。以購買成本估算:7B 約 6–10 萬、70B 約 80–150 萬、405B 約 800 萬以上。租用雲端 GPU 是降低初期投資的好選擇,月費約落在 1–30 萬。
主流推論框架:vLLM(最快、社群最廣,適合多用戶併發)、Ollama(最易上手,適合開發測試)、TGI(HuggingFace,整合 HF 生態)、llama.cpp(CPU / Apple Silicon 也能跑)。生產環境建議 vLLM + Kubernetes 自動擴縮容,搭配 NGINX / Envoy 做負載平衡。
一、純內網 + GPU 工作站:完全離線,最高安全。二、私有雲(VPC)+ 雲端 GPU:彈性與安全平衡,多數企業選這個。三、Hybrid:機密資料走私有 LLM、一般任務走 Cloud LLM。四、On-prem + Vector DB(RAG):將公司知識文件做向量化,模型透過 RAG 取用最新資料。
2026 年開源 70B 模型在多數企業任務(摘要、分類、客服回覆、文件問答)已達 GPT-4o 約 80–90% 水準,405B 可達 95% 以上。差距主要在多模態、複雜推理、極長上下文。建議先用 RAG + 70B 跑 1–2 個情境驗證,比直接放棄 cloud API 更務實。
私有 LLM 仍可能被 Prompt Injection、模型權重外洩、Log 收集不當而出問題。導入前需建立:API Token 控管、Prompt 紀錄與遮罩、模型版本控管、Red Team 測試、定期權限稽核。山葵組通常會把這些列入導入 SOP。
建議三階段:第一階段(1 個月)用 Ollama + 7B 在 PoC 環境試跑常見任務。第二階段(2–3 個月)導入 70B + RAG + vLLM 在私有雲跑 1 個業務情境。第三階段(6 個月以上)擴展到多部門、多場景並建立 LLMOps。想評估是否該私有部署?歡迎到 山葵組 AI 服務 或 聯絡山葵組。更多 AI 實戰文章請見 山葵組部落格。私有企業