Ollama 是一套能讓你在自己的電腦上輕鬆執行大型語言模型(LLM)的工具。你不需要設定繁雜的 CUDA、PyTorch 或環境依賴,也不必自己處理模型格式與量化版本,只要一條指令、或用內建的桌面介面點兩下,就能載入並使用 Llama、Gemma、Qwen、DeepSeek-R1、Phi 等主流開源模型。它近期還推出了雲端版,讓你在同一套工具裡直接呼叫跑在雲端的超大模型。
這篇文章將以清楚的 SEO 結構介紹 Ollama 的特色、安裝方式、使用方法、適合的模型選擇,以及實際應用場景。

Ollama 的核心概念
本地端推論最大保障隱私
Ollama 把模型運算和資料處理全放在你自己的機器上完成,過程不必連網、內容也不會傳出去。對在意隱私、或手上有機密資料的人來說,這一點就把外洩風險降到最低。
不需要配置模型環境
自己跑過 AI 模型的人都知道,最惱人的往往是前置環境:要建虛擬環境、對照顯卡與驅動版本裝一堆相依套件,搞到最後模型還不一定跑得起來。
Ollama 把模型下載、格式轉換、硬體偵測全包成一條龍,省掉這些設定功夫,幾行指令就能開始用這些大型語言模型。
對於 API 非常友善
Ollama 內建 HTTP API,可以直接接進你自己的程式、服務、自動化腳本或後端系統;想架在網路上供遠端呼叫也沒問題。
支援跨平台
Windows、macOS、Linux 都有原生版本,硬體上也涵蓋 NVIDIA、AMD 顯卡與 Apple Silicon,不挑作業系統。
Ollama 的主要功能
1. 模型管理與下載系統
Ollama 內建一套完整的模型管理機制,下載、更新、儲存都幫你打理好。你不必自己處理 GGUF 格式、挑量化版本,也不用手動指定模型路徑,上手成本因此低了很多。
核心功能包含:
- 自動下載模型
- 模型版本切換
- 量化格式管理
- 本地快取與儲存機制
主流的開源模型,像 Llama、Gemma、Qwen、DeepSeek、Phi,都能一行指令抓下來用。
2. 本地端推論引擎(Local Inference Engine)
Ollama 的本地推論引擎在 CPU 和 GPU(NVIDIA、AMD、Apple Silicon)上都跑得動,還會依你的硬體自動挑最合適的推論方式,不用自己調。
主要推論能力:
- 支援 GGUF 模型格式
- 多種量化加速(Q2~Q6 等)
- 自動偵測硬體資源
- 並行對話與多模型運行
在自己的機器上跑大型語言模型,也能兼顧速度與穩定。
3. 內建桌面聊天介面(免裝額外前端)
Ollama 現在內建一個簡潔的桌面聊天介面,安裝完打開就能像用 ChatGPT 一樣直接跟模型對話,不必再自己架 Open WebUI 這類前端。畫面右下角可以隨時切換模型,選到還沒下載的模型時它會自動幫你抓下來。

特點包含:
- 即問即答的互動對話
- 可存取記錄
- 支援多輪對話
- 支援多模型隨時切換
也因為這樣,Ollama 從一開始就常被說成是「可以裝在自己電腦裡的 ChatGPT」。
4. 本地 API 伺服器(Local HTTP API)
Ollama 啟動時會自動開一個本地 HTTP API,開發者用程式就能呼叫模型,不必另外架伺服器。
API 提供:
- Text generation
- Streaming 回應(即時輸出)
- Chat / embedding 支援
- 與任何語言/框架整合(JavaScript、Python、PHP、Go 等)
這也是它能輕鬆串接各種工具、外掛與自動化流程的關鍵。
5. 自訂模型建構系統(Modelfile)
除了使用官方模型之外,Ollama 還提供 Modelfile,讓使用者可以:
- 基於某個 base model 建立新模型
- 加入預設 system prompt
- 內建特定角色設定
- 加載自訂資料
- 控制推論參數(temperature 等)
Modelfile 的概念很像 Dockerfile,是一份「模型定義檔」,照它就能打造出你專屬的 AI 模型。
6. 模型打包與分發機制
自訂好的模型可以打包分享給別人,對方不必再收一堆設定檔就能重現。
你可以使用 Ollama:
- 匯出模型
- 發布模型
- 建立可重現環境
這能提升團隊協作效率,也適合企業內部或遠端團隊共用同一套模型環境。
7. 跨平台支援與一致體驗
三大作業系統都有原生版本,而且指令、模型格式、API 完全一致。
這意味著:
- 你可以在 Mac 上開發、在 Linux server 部署
- Windows 環境也能本地跑 LLM
- 文件與教學不會因平台而分裂
幾乎做到「學一次,到哪都能用」。
8. 高度整合的擴充生態圈
由於 Ollama API 架構簡單,大量生態系快速成長,包括:
- VSCode 插件
- Web UI(OpenWebUI、Chatbox 等)
- 自動化工具(LangChain、LlamaIndex)
- 輕量伺服器框架(Node.js、Python)
- RAG 架構整合
- Home Assistant / 其他 IoT 工具
可以說,Ollama 本身就是一個「跑在自己機器上的 AI 平台」。
Ollama 可以用來做什麼?
建立本地 ChatGPT 替代方案
對話、翻譯、生成內容,用起來跟雲端服務沒兩樣,差別是所有資料都只留在你自己的電腦裡。
開發 AI 工具與應用
包含:
- 桌面助理
- 自動化腳本
- 開發者工具
- VSCode 自動補全
- 後端 API
- Line bot / Discord bot
建立企業私有知識庫(RAG)
搭配 Chroma、Milvus 這類向量資料庫,再用 LangChain 或 LlamaIndex 串起來,就能打造一套完全私有的文件問答系統。
實驗不同模型與量化格式
方便比較:
- 7B vs 13B
- Q4_K_M vs Q6
- Llama vs Gemma vs Qwen
如何安裝 Ollama
Windows 及 macOS 安裝
可以直接前往官網下載安裝程式,裝好後開啟終端機即可使用。
後面以 Windows 版本示範。
1. 前往 Ollama 官方網站下載對應作業系統的版本。

2.下載完畢後,點開所下載的檔案;視窗開啟後點選 Install,Ollama 就會開始安裝。

3. Ollama 安裝完畢後,會直接進入聊天介面。

4.右下角可以選擇想使用的開源模型,這邊測試先選擇 Google 出品的 gemma3 1b 模型,並提出第一個問題;程式會自行下載對應的語言模型,連指令都不必輸入。


5.當對應的語言模型下載之後,程式會開始調用該模型並針對問題進行回答。

Linux 安裝
使用官方 Script:
curl -fsSL https://ollama.com/install.sh | shCode language: Bash (bash)
想把模型裝到其他磁碟(省系統碟空間)
Ollama 下載的模型預設放在系統碟(Windows 在 C 槽的使用者資料夾底下),而模型動輒好幾 GB、越裝越多,很容易把系統碟塞滿。想改放到別的磁碟,設一個環境變數 OLLAMA_MODELS 指到你要的資料夾就行,例如指到 E:\Ollama\models,設好後重新啟動 Ollama,之後下載的模型都會存到那裡。
Ollama 的基本指令與使用方式
如果你習慣用命令提示字元或終端機,也可以直接用指令操作 Ollama。
執行模型
ollama run {模型名稱}Code language: Bash (bash)
下載模型
ollama pull {模型名稱}Code language: Bash (bash)
列出已安裝的模型
ollama listCode language: Bash (bash)
停止運行
終端機按 Ctrl + C。
如何使用 Ollama 的 API
基本示例
curl http://localhost:11434/api/generate -d '{
"model": "gemma3",
"prompt": "什麼是 Ollama?"
}'Code language: Bash (bash)
回應類型
API 預設會以串流(streaming)方式逐行把生成內容吐回來,很適合接到聊天框做即時輸出。
把 Ollama 接上常用工具
Ollama 真正好用的地方,是它那個相容 OpenAI 格式的本地 API,讓它可以輕鬆接上各種現成工具。以下是幾個最常見的組合。

用 Open WebUI 打造本地版 ChatGPT
想要一個像 ChatGPT 那樣的網頁聊天介面(多對話、資料夾、提示詞管理、上傳文件問答),最主流的選擇是開源的 Open WebUI。最簡單的方式是用 Docker 啟動,讓它連到你本機的 Ollama:
docker run -d -p 3000:8080 \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:mainCode language: Bash (bash)
啟動後開瀏覽器連 http://localhost:3000,第一次進去建立管理員帳號即可。它會自動抓到你 Ollama 裡已下載的模型,直接在網頁上切換對話。
用 Python 呼叫 Ollama
想把模型寫進自己的程式,官方有 Python 套件,先安裝:
pip install ollamaCode language: Bash (bash)
一段最小的串流對話範例:
import ollama
stream = ollama.chat(
model="gemma3",
messages=[{"role": "user", "content": "用一句話解釋什麼是向量資料庫"}],
stream=True,
)
for chunk in stream:
print(chunk["message"]["content"], end="", flush=True)Code language: Python (python)
stream=True 會邊生成邊回傳,適合做即時輸出的聊天框;拿掉它就會等整段生成完再一次回傳。JavaScript、Go 等語言也有對應的官方套件,用法類似。
在 VS Code 裡做本地程式補全
寫程式的話,可以在 VS Code 裝 Continue 這類外掛,把補全與問答的後端指向本機 Ollama,再選一顆程式模型(例如 qwen3-coder)當引擎。這樣就有一個完全在本機、不上傳程式碼的 AI 助手,很適合公司程式碼不能外流的情境。
建私有知識庫(RAG)
想讓模型根據你自己的文件回答,靠的就是 RAG(檢索增強生成)。流程大致是:先用一顆 embedding 模型(例如 nomic-embed-text)把文件切段、轉成向量存進向量資料庫(如 Chroma),提問時先從資料庫撈出最相關的段落,再連同問題一起交給 Ollama 的語言模型回答。LangChain、LlamaIndex 都有現成的 Ollama 接口,可以少寫很多程式。
其他整合
Ollama 的生態很廣,還能接自動化流程工具 n8n、智慧家庭 Home Assistant,以及各種聊天機器人框架。只要對方支援「自訂 API 位址」或「OpenAI 相容端點」,多半都能把後端換成本機的 Ollama。
Ollama 常見模型與適用情境
Llama 3.3 / Llama 4(Meta)
綜合能力均衡,最泛用的主力模型。
Llama 系列在語言理解、邏輯推理、寫作、程式碼、長文表現都相當平均,是很多人本地部署的第一選擇。Llama 3.3 以較小的參數量做到接近前代大模型的水準,Llama 4 則進一步強化多語言與長脈絡處理,拿來當日常問答、摘要、寫作的通用引擎都很稱職。
Gemma 3(Google)
輕巧、支援視覺與多語言,小硬體也跑得動。
Gemma 3 提供 1B、4B、12B、27B 等多種尺寸,最小的 1B 連內顯或入門顯卡都能順跑,較大的版本還支援讀圖與上百種語言。語言風格整齊、輸出穩定,是想在一般筆電或桌機上入門、又想兼顧品質的好選擇。
Qwen 3(阿里巴巴)
中文能力強,還有專攻程式的版本。
Qwen 系列在中文語感、用詞、生活化對話上一直很強,是華語使用者的熱門選擇。第三代整體推理與指令跟隨都有提升,另外還有專門強化程式能力的 qwen3-coder,寫程式、補全、重構都很在行,適合中文寫作與開發兩種需求。
DeepSeek-R1(深度求索)
會「先想再答」的推理型模型。
DeepSeek-R1 主打推理,回答前會先展開一段思考過程再給結論,對數學、邏輯、複雜問題的表現特別突出。官方還推出蒸餾版本,把推理能力壓進 8B、14B、32B 等較小尺寸,讓一般硬體也能體驗到推理模型的好處。
Phi-4(Microsoft)
參數小、知識密度高,擅長理科與推理。
Phi 系列走「小而精」路線,用相對少的參數達到出乎意料的水準,尤其在數理、邏輯、結構化回答上表現亮眼。回答清晰、邏輯乾淨,適合硬體資源有限、又想要好推理品質的使用者。
Mistral 系列
速度快、資源需求低,適合高頻互動。
Mistral 以高效率著稱,同等參數下推理速度快、記憶體占用低,語言生成品質也不錯,特別適合需要快速回應或頻繁多輪對話的場景。
該怎麼挑一顆模型?
模型庫在 ollama.com/library,每顆模型底下會列出不同的 tag,例如 gemma3:4b、qwen3:8b-q4_K_M。冒號後面通常是參數量(4b 就是 40 億參數)與量化版本,參數量越大越聰明、但越吃硬體。挑選時可以照「用途」和「硬體」兩條線走:
- 看用途:一般問答與寫作選 Llama 或 Gemma;中文為主選 Qwen;要寫程式選 qwen3-coder;要邏輯推理選 DeepSeek-R1;要讀圖選有視覺能力的 Gemma 3;要做 RAG 的向量檢索,則另外裝一顆 embedding 模型(如 nomic-embed-text)。
- 看硬體:只有 CPU 或內顯,從 1B~4B 的小模型起手;有 8GB 左右的顯卡,7B~8B 跑起來很舒服;有 24GB 以上的高階卡,才適合挑戰 27B~32B;再往上的巨型模型,交給後面會提到的雲端版比較實際。
建議先用小模型把整套流程跑通、確認接得起來,再視需要換更大的模型。

使用 Ollama 所需的硬體需求
用 GPU 推論的硬體建議
模型參數越多,需要的 VRAM(顯卡記憶體)就越高。抓一個大概的對照:
- 1B~4B 小模型:約 2~4GB VRAM,一般內顯或入門獨顯就能跑
- 7B~8B:約 6~8GB VRAM,例如 RTX 3060/4060 等級
- 13B~14B:約 10~16GB VRAM
- 27B~32B:約 24GB VRAM 以上,需要 RTX 4090/5090 這類高階卡
- 70B 以上:多半要多張顯卡或工作站級 GPU,這時改用雲端版會更省事
顯卡記憶體不夠時,Ollama 會把放不下的部分改用 CPU 與系統記憶體分擔,還是跑得動,只是速度會慢一些。
用 CPU 與記憶體推論的硬體建議
沒有獨立顯卡也能跑。量化後的 GGUF 模型會載入系統記憶體(RAM),所以用 CPU 推論時,先確保 RAM 明顯大於模型檔案大小,並盡量選 1B~8B 這類小模型,體感才會流暢。
進階設定與效能調校
Ollama 預設就能用,但幾個環境變數能讓它更貼合你的需求。Windows 上的設定方式是:先在工作列圖示按右鍵結束 Ollama,到「編輯系統環境變數」新增使用者變數,設好再重新開啟 Ollama。
OLLAMA_HOST:Ollama 監聽的位址,預設只綁本機127.0.0.1:11434。設成0.0.0.0就能讓區網內的其他裝置(手機、另一台電腦)連進來共用,等於把家裡一台機器變成小型 AI 伺服器。OLLAMA_KEEP_ALIVE:模型用完後在記憶體裡停留多久,預設 5 分鐘。設-1讓模型常駐,下次回應免再載入、反應更快;設0則用完立刻卸載,把記憶體讓出來。OLLAMA_NUM_PARALLEL:同時處理幾個請求,資源夠的話調高,能提升多人同時使用的吞吐量。OLLAMA_CONTEXT_LENGTH:預設的上下文長度(token 數),預設 4096。要餵長文件或長對話時可以調高,但會吃更多記憶體。
量化格式怎麼選
同一顆模型在 Ollama 上常有多種量化版本,名稱後面會標 q4_K_M、q5_K_M、q8_0 之類。量化就是把模型權重壓縮,數字越小、檔案越小、越省記憶體,但品質會略降。實用原則是:預設的 q4_K_M 在品質與體積之間最平衡,是多數情境的首選;記憶體很吃緊就選更低的量化,想要接近原始品質、硬體也夠就上 q8。
常見問題排解
- 模型跑很慢或跑不動:先確認記憶體或顯卡記憶體夠不夠裝下這顆模型,不夠就換更小的尺寸或量化版本;1B~8B 是低階機器的安全範圍。
11434連接埠被占用:可能已經有一個 Ollama 在跑,或被其他程式占用。可用OLLAMA_HOST換一個埠(例如127.0.0.1:11500),客戶端也記得指到同一個位址。- 更新、刪除、查看模型:
ollama pull 模型名會把模型更新到最新版;ollama rm 模型名刪掉不用的模型、釋放空間;ollama ps看目前有哪些模型正載入在記憶體裡;ollama list看已下載的全部模型。 - 想知道發生什麼事:Ollama 的伺服器日誌會記錄載入了哪顆模型、用到 GPU 還是 CPU、有沒有出錯,遇到問題時先翻日誌通常能找到線索。
Ollama 適合哪些人使用?
個人使用者
想用 AI 協助工作、內容創作、學習或離線使用。
Ollama 直接在自己的電腦上跑模型,不必依賴雲端服務,寫作、整理筆記、學習輔助、翻譯這些日常需求都罩得住。就算硬體不強,挑一顆量化小模型也能順順地用,是一般人最容易入門的本地 AI 工具。
開發者
需要可本地化、低延遲、低成本的 LLM 環境。
簡潔的本地 API、模型管理、版本控制加上隨時切換模型,讓它很好整合進網站、應用程式、外掛、聊天機器人或後端流程。支援 GGUF 與眾多模型,測試、部署、迭代都很快。
中小企業與團隊
希望保護資料隱私、建置私有知識庫或內部工具。
把模型部署在本地或內網,資料不必送到第三方雲端,隱私風險大幅下降。客服自動化、內部文件問答、SOP 整理、行政流程加速都用得上,硬體成本也相對好控制。
AI 愛好者與研究者
想比較不同模型、測試模型表現或製作工具。
支援各種開源模型與量化格式,載入、切換、調整都很快,很適合拿來跑 Benchmark、測提示詞、比較模型行為,或做外掛開發、教學與個人研究。
Ollama 雲端版(Ollama Cloud):本機跑不動的大模型交給雲端
本地部署最現實的限制就是硬體:想跑上百億參數的頂尖模型,家用顯卡多半吃不消。為此 Ollama 推出了雲端版,讓你在同一套工具裡直接呼叫跑在它雲端伺服器上的模型。
它的設計很直覺:雲端模型用起來跟本地模型幾乎一樣,一樣的指令、一樣的桌面介面,差別只在運算是在雲端完成,所以不吃你的顯卡。對開發者來說,它提供與本地相同、且相容 OpenAI 格式的 HTTP 端點,程式碼幾乎不用改,只要把連線位址換成雲端即可。
這樣做最大的價值,是能試用那些本機根本裝不下的超大模型,例如 Kimi K2、DeepSeek-V4、GLM 以及數百億參數等級的 Qwen 大模型。方案上有免費額度可以先試玩,也有 Pro、Max 等付費方案,依 GPU 使用時間計費,用量大再升級即可。
要留意的是,雲端版的資料會送到 Ollama 的伺服器處理,就不像純本地那樣全程留在自己的電腦裡。如果你要的正是資料不出門的隱私保障,敏感內容還是走本地模型;把雲端版當成臨時借一張大顯卡來跑大模型,會是比較合理的分工。

Ollama 把「在自己電腦上跑大型語言模型」這件事變得很簡單:安裝快、模型多、速度不差,還附一組本地 API,資料完全握在自己手裡。不論你是想找一個雲端服務的替代方案、開發 AI 工具,還是打造不必連網的私有環境,它都是現在最成熟、也最好上手的選擇之一。
