欢迎来到开源软件网 - 安全、纯净、免费的开源软件下载平台
📦

Ollama

版本:v0.32.1‌
大小:171MB
语言:英文
系统:‌Windows‌、macOS‌、‌Linux‌
更新:2026.07.18
授权:
💡

可替代商业软件

可替代云端大模型 API 服务‌(如 OpenAI GPT 系列、Anthropic Claude、Google Gemini、国内千问/混元等按量付费接口):Ollama 提供本地免费推理端点,支持 curl 或代码调用,完全规避订阅费与按 Token 计费 。 ‌付费 AI 聊天客户端/助手‌(如 ChatGPT Plus、Copilot Pro、Kimi 高级版):搭配 Open WebUI、LobeChat 等前端,构建私有化对话界面,实现同等交互体验且数据不离本地 。

⬇️ 立即下载

✅ 安全无毒 | 无捆绑软件 | 官方原版

📖 软件详细介绍

Ollama 是一个免费、开源、跨平台的工具,旨在让你在本地电脑上极简地运行和管理大型语言模型(LLM),如 Llama、Mistral、Gemma 等。它把复杂的模型量化、GPU 调度、API 服务等都封装好,即使不是机器学习专家,也能用一条命令在本地运行强大的 AI 模型。

核心功能

  • 一键拉取与运行模型
    通过 ollama run <模型名> 命令,即可自动下载并启动模型。模型库包含上千种开源模型,覆盖通用对话、代码生成、数学推理等场景。
  • 本地 REST API
    启动模型后,会在本地 11434 端口提供一个标准的 API,与 OpenAI API 兼容。你可以用任何支持自定义端点的客户端(如 Chatbox、Open WebUI)或直接使用 curl 与其交互,方便集成到自己的应用中。
  • 模型管理与定制
    • 模型文件:可以创建 Modelfile,像写 Dockerfile 一样定义模型参数、系统提示词、温度等,并生成自定义模型。
    • 量化与导入:支持直接导入 GGUF 格式的模型文件,并对模型进行量化,以平衡性能和资源占用。
    • 多模型共存:可同时下载多个不同版本的模型,并能方便的切换、查看、删除和复制模型。
  • 多模态模型支持
    从较新版本开始,Ollama 支持图像理解的视觉模型(如 LLaVA、Gemma 3 等),可以传入图片让模型分析内容。
  • 会话保持与上下文记忆
    在命令行交互模式下,Ollama 会保留对话上下文,支持多轮连续对话。也可以通过 API 传入消息历史,实现自定义记忆逻辑。
  • 跨平台与多 GPU 支持
    原生支持 macOS (Apple Silicon 加速)、Linux (NVIDIA/AMD GPU 加速、CPU 推理) 和 Windows。能自动检测并利用 GPU,也支持多 GPU 并行加速。

主要优势

  • 极低的入门门槛
    安装后只需一条命令即可体验最先进的本地 AI,完全不需要手动配置 Python 环境、CUDA 驱动或模型文件,把玩大模型的门槛降到了最低。
  • 完全的隐私与离线使用
    所有数据和推理都在本地完成,无需联网(仅下载模型时需网络),对话记录绝不离开你的设备,从根本上杜绝数据泄露风险。这是相对于云端 AI 服务的最大优势。
  • 免费、开源且生态丰富
    采用 MIT 许可证,完全免费商用。社区极其活跃,有大量配套工具,如 Web UI(Open WebUI)、桌面客户端、Obsidian 插件、编程语言 SDK 等,生态繁荣。
  • 资源可控与高性能
    模型运行在本地,可精确控制显存/内存用量。通过量化技术,甚至可以在 8GB 内存的普通电脑上流畅运行 7B 级别的模型。同时利用 GPU 加速,推理速度很快。
  • 统一的开发接口
    提供与 OpenAI 兼容的 API,意味着很多已经为 ChatGPT 开发的工具和应用,只需将 API 地址指向本地,就可以无缝切换为本地模型,极大降低了迁移成本。
  • 透明与自托管
    作为自托管方案,你可以完全掌握模型运行的全过程,适合对数据主权有严格要求的企业或个人。不用担心 API 服务突然变更、涨价或停服。

⚙️ 系统要求

操作系统‌:
Windows 10/11(64 位,Build 19041+,需启用 WSL 2);macOS 12(Monterey)及以上(支持 Apple Silicon 及 Intel);Linux(glibc 兼容发行版如 Ubuntu 20.04+、Debian、Fedora)。
‌CPU‌:
x86_64 架构需支持‌AVX2 指令集‌(约 Intel 第 7 代/AMD Zen 以后);ARM64(M 系列芯片)原生支持。
‌内存‌:‌
8GB 为绝对最低限‌(仅能运行极小模型),‌16GB 建议起步‌(流畅运行 7B 量化模型),大模型(13B+)建议 32GB+。
存储‌:
安装包极小,但需预留‌模型文件空间‌(7B 量化版约 4-5GB,70B 约 40GB+),建议 SSD 且预留‌≥20GB 可用空间‌。
GPU(可选但推荐)‌:
NVIDIA 显卡(CUDA 支持)可显著提升速度,显存需大于模型加载占用(如 8GB 显存可跑 7B-13B 量化模型);AMD GPU 支持有限(需 ROCm);Mac 利用 Metal 加速无需独立显卡