一家 200 人公司每月燒 18 萬在 AI 搜尋訂閱上。但現在一個免費的 2.3B 小模型加一支 Tavily API,幾乎能做到一樣的事。這篇手把手教你怎麼裝、怎麼下提示詞、怎麼在 Codex / Claude Code 裡接 Ollama。
目錄+
先講一個數字。
一家 200 人的公司,每個月光花在「AI 搜尋」這件事上的訂閱費,差不多就是 18 萬台幣。Perplexity 一個人 $40、Glean 一個人 $45、ChatGPT Team 一個人 $30——堆一堆,老闆看帳單時臉很臭。
但現在這些工具能做的事,一個免費的小模型加一支搜尋 API,幾乎全包了。這篇用最白話的方式跟你說:為什麼這件事現在才成立、怎麼裝、怎麼下提示詞、最後怎麼在你已經在用的 Codex 或 Claude Code 裡接起來。
先看看你現在付了多少錢
把幾家主流 AI 搜尋產品的企業版定價放一起,長這樣:
企業 AI 搜尋工具每人每月費用(USD)
最後一條 $3 是自己接的成本。Tavily 用多少算多少,一次搜尋大概 $0.01,員工一天搜 10 次,一個月加起來就這個數。模型本身免費,跑在你公司現成的伺服器上,完全不額外付錢。
差的不是一點點,是十倍以上。
為什麼以前不能做,現在可以?
兩年前談「用 2B 小模型取代 Perplexity」是笑話。三個門檻過不去:模型笨、記不住長文件、不會用工具。
2026 年這三道牆同時倒了:
重點是中間那塊 128K context。
以前小模型像閉卷考的考生,要靠記憶力答題,記不住就掰。現在 128K context 等於開卷考,你把整本參考書放在桌上,它只要負責看書、抄重點就好。
小模型不會想沒關係,只要它會抄、會整理就夠了。
三個角色的分工
把這套架構想成一個小組:
- 實習生(Gemma 4 E2B)——聰明但經驗不足。先判斷「這題需不需要查資料?」,最後負責把資料寫成回答
- 資料庫管理員(Tavily)——你問什麼,他真的去網路上找最新資料,每條都附來源
- 會議桌(128K Context)——夠大,能把資料管理員找回來的所有資料全部攤開讓實習生看
過去 Perplexity 把這三個角色包成一個產品賣你 $40。一旦你願意自己組這個小組,每個角色都有免費或便宜的替代品。
企業 AI 搜尋的護城河,不是模型,是搜尋 API 的接入。Tavily 一接,護城河就乾了。
動手裝:30 分鐘搞定
不需要工程師團隊。一台普通電腦、一個下午就能跑起來。
Step 1:裝 Ollama(5 分鐘)
Ollama 是「本地跑 AI 模型」的免費工具,可以想成是模型版的 Docker。
- macOS / Windows:到 ollama.com 下載安裝檔,按下一步、下一步、完成
- Linux:終端機跑這行就好
curl -fsSL https://ollama.com/install.sh | sh
裝完打開終端機(Mac 是 Terminal、Windows 是 PowerShell),輸入 ollama 有看到指令說明就成功了。
Step 2:下載 Gemma 4 E2B 模型(10 分鐘,看你網速)
在終端機輸入:
ollama pull gemma4:e2b
模型約 2GB,下載完直接可用。要先試試感覺,跑這行:
ollama run gemma4:e2b
然後就可以直接跟它聊天,跟用 ChatGPT 一樣。Ctrl+C 離開。
Step 3:申請 Tavily API Key(5 分鐘)
Tavily 是「給 AI 用的搜尋引擎」,回傳的不是 Google 那種藍色連結,而是已經整理好的內容片段加來源。
- 到 tavily.com,用 Google 帳號註冊
- 進 Dashboard 後,免費方案每月送你 1,000 次搜尋(個人試用綽綽有餘)
- 複製 API Key,等下要用
到這裡,所有的工具都齊了。
提示詞範本:直接抄
把下面這段貼到 Ollama 對話視窗(先把 {使用者問題} 跟 {Tavily 回傳的資料} 換成實際內容),就能立刻測試。
範本 A:純內部知識庫問答
你是一個內部文件助手。請完全根據下方「參考資料」回答使用者的問題。
規則:
1. 只能引用「參考資料」裡的內容,不要自己加東西
2. 每個重點後面用 [來源 N] 標註是第幾筆資料
3. 如果資料不夠回答,直接說「資料中沒有提到這點」,不要猜
【參考資料】
{把 Tavily 或你公司文件貼這裡}
【使用者問題】
{使用者問題}
範本 B:要不要查網路的判斷
判斷下面這個問題需不需要查最新網路資料。
規則:
- 涉及「最近」「目前」「今年」「最新」→ yes
- 涉及具體公司、產品、人物的近況 → yes
- 一般概念解釋、寫程式、翻譯 → no
只回 yes 或 no,不要解釋。
問題:{使用者問題}
範本 C:給主管用的「日報摘要」
你是一個資深分析師。下方是今天我從網路上抓到的關於 {主題} 的最新資料。
請寫一份 200 字以內的中文摘要,給沒時間細讀的主管看。結構:
1. 一句話結論
2. 三個值得注意的點
3. 一個需要主管決策或關注的問題
【今日資料】
{Tavily 回傳的資料}
這三個範本涵蓋八成日常情境。要更進階的 prompt,把這三個當骨架自己加條件就好。
在 Codex 或 Claude Code 裡接 Ollama
很多人問:我已經在用 Codex CLI 或 Claude Code 寫程式,能不能讓它用本地 Ollama 而不是雲端模型?可以,兩種接法。
方法 1:直接呼叫本地 Ollama API
Ollama 安裝好之後,會自動開一個本地 server,網址是 http://localhost:11434。任何工具只要支援 OpenAI 相容 API,把 base URL 改成這個就可以用本地模型。
設定環境變數:
OPENAI_BASE_URL=http://localhost:11434/v1
OPENAI_API_KEY=ollama-local
Codex CLI / 大部分支援自訂 endpoint 的工具,把這兩個變數設好,模型指定 gemma4:e2b,呼叫的就是本地 Ollama。
方法 2:用 Claude Code 但讓某些 task 走本地
Claude Code 沒有原生支援切換到 Ollama,但可以用 hook 或 subagent 包一層。實務上更常見的做法:寫一個 shell command,讓 Claude Code 在需要「便宜輕量推理」時呼叫本地 Ollama。
舉例,建一個 local-summarize 指令:
#!/bin/bash
# 把第一個參數丟給本地 Gemma 摘要
echo "$1" | ollama run gemma4:e2b "請用 50 字以內中文摘要這段:"
然後在 Claude Code 裡指示它「需要摘要長文件時呼叫 local-summarize」,雲端就不用算這些雜事,省 token。
硬體建議
E2B 模型量化後大概只吃 4GB RAM,用 CPU 就能跑,但慢一點。要快一點就配一張入門 GPU。一台 ROG GR70 R9 + RTX 5070 的迷你主機 塞在公司角落,撐 20–50 人內部搜尋負載沒問題,桌面只佔一個衛生紙盒大小。
該不該做?我幫你列清單
不是每家公司都該自己幹。先對照下面這張表。
你公司符合下面狀況,建議認真試試看:
- 內部資料量大、查詢頻率高,訂閱費已經痛到了
- 是金融、醫療、法律這種資料絕對不能外流的產業
- 想先用幾千塊驗證「員工真的會用 AI 搜尋嗎」再決定要不要買商業方案
- 已經訂閱 Perplexity 或 ChatGPT Team,老闆想知道「自己做能省多少」
你公司符合下面狀況,不要自己搞:
- 是高並發對外服務(例如客服機器人),延遲一秒鐘使用者就跑了
- 業務需要 GPT-5 等級的複雜推理(律所做法律分析、寫商業策略報告)
- 沒有任何 IT 維運人力,主機掛了沒人會重開
- 想做多個 AI agent 互相協作的複雜流程
主管你應該問工程師這個問題
不是問「我們有沒有辦法自己做」,而是問——
「如果我們停掉 Perplexity 的訂閱,把那筆預算的 10% 拿來做 PoC,三個月後你能不能拿出資料告訴我:哪些查詢類型該留在商業方案、哪些可以永遠搬到自建?」
這問題比較有用。它逼工程師用資料說話、逼產品團隊看清楚使用者真正在用什麼功能、逼老闆從「比較功能表」變成「比較每月帳單」。
而這就是 2026 年所有 AI 落地題的標準姿勢——不是選邊站,是切開來算。
利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。