Ollama 是什么?
Ollama 是一个让你在自己电脑上下载、运行大语言模型的工具。
云端 API 像「每次去餐厅点菜、按次付钱」;Ollama 像「把厨师请回家」——模型文件落在硬盘里,本机起一个服务,你的程序随时调用,调试时不烧 API 额度,数据也可以不出电脑。

它解决什么问题?
| 场景 | 为什么用 Ollama |
|---|---|
| 练 Prompt、写 demo | 反复试不怕贵 |
| 公司内网 / 敏感资料 | 文本不必上传公网 |
| 没网或网络差 | 模型已在本地,仍可推理 |
| 开发 / 上线两套环境 | 本地调通,再换云端 API 上线 |
Ollama 不是替代所有云端模型——小模型本机跑,复杂任务仍可用 GPT、DeepSeek 等云端。它是开发者的本地工作台。
举例:本机问 AI 一句话
安装 Ollama 后,终端里:
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "用一句话解释什么是 Agent"
背后发生的事:
- pull:把模型权重下载到硬盘(像安装一个大软件)
- run:启动 Ollama 进程,加载模型
- 你的问题 → 本机
localhost:11434→ 模型推理 → 返回答案
你的 Python / Node 程序也可以请求同一个地址,和调云端 API 类似,只是 URL 换成本机。
和云端 API 怎么配合?
开发 KunSpace 某个 AI 功能时,可以这样分工:
- 写 Prompt、测流程 → Ollama 本地,改十遍也不心疼
- 正式上线 → 换成 DeepSeek / OpenAI 等,智商更高、延迟更低
很多 SDK 支持只改 base_url,同一套代码两处都能跑——这是 Ollama 对入门者最友好的地方。
总结
Ollama = 本地大模型运行时:下载模型、起服务、提供统一接口。
它让「AI 能力」从遥远的云端,变成你电脑上可按需开关的一台引擎——搞懂这一点,你就明白为什么学 Agent 之前,很多人会先装一个 Ollama 玩起来。
评论
还没有评论,来做第一个吧
赞同、吐槽、提问都行,评论区开放