本地部署工具 分类 - AI 工具网

关于本分类

AI 本地部署工具帮助用户在本机或内网运行大模型与应用,强调数据隐私与离线可用。本分类汇集一键部署、可视化管理类产品。

适用场景:本机运行开源大模型、可视化模型管理、离线推理与对话、私有知识库搭建、多模型统一入口

使用建议:本地部署对硬件(尤其是显存)有要求,建议先确认模型体积与设备配置匹配;涉及敏感数据优先选本地方案。

Q:本地部署需要多高配置?

入门 7B-8B 模型约需 8GB 显存,更大模型需更多显存或量化压缩,具体看模型规格。

Q:本地部署的数据安全吗?

数据不出本机,隐私性优于云端,但仍需做好访问权限与系统安全防护。

站长亲测

真实推荐 · 含推广链接

热门工具

13 个工具
llama.cpp

llama.cpp

开源

C/C++ 写的本地大模型推理框架,GitHub 约 12.7 万 star,几乎每天有提交,是本地部署生态里最常用的推理后端之一。定位早已不限于 LLaMA 系列,官方示例直接用 Qwen,支持各类 GGUF 模型。后端覆盖 CUDA、HIP、Metal、Vulkan、SYCL、CANN、MUSA、WebGPU 甚至 RISC-V,支持 1.5-8bit 量化和 CPU+GPU 混合推理,自带 llama-cli、llama-server(OpenAI 兼容 API + 内置 Web UI)。适合用消费级显卡跑本地模型,也常被其他项目当作底层推理引擎。版本发得极勤,追具体版本号意义不大。

LocalAI

LocalAI

开源

用 Go 写的开源本地 AI 推理服务器,主打 OpenAI 兼容 API,可以直接替换掉依赖 OpenAI 接口的应用而不用改代码。官方称无需 GPU 也能跑 LLM、视觉、语音、图像、视频,最新版 v4.9.0(2026 年 8 月)改为默认拒绝式鉴权,新增端到端上下文压缩和 vllm-cpp 视频模态支持。MIT 协议,GitHub 约 4.9 万 star,仍在活跃维护。适合想在自有硬件上快速挂一个 OpenAI 风格接口的团队;覆盖面广但依赖后端组合,性能调优成本比单一用途框架高。

Text Generation WebUI

Text Generation WebUI

开源

本地大模型的桌面 / Web 操作界面,Gradio 界面跑在本地 7860 端口,是最老牌的本地模型前端之一。注意:项目仓库已更名为 oobabooga/textgen,是同一个项目的新名字。支持 llama.cpp、Transformers、ExLlamaV3、TensorRT-LLM 多种后端切换,含视觉、文档问答、工具调用与 MCP、LoRA 训练、图像生成,以及 OpenAI / Anthropic 兼容 API。便携版用 Electron 封装、解压即用,但仅支持 GGUF,完整功能需完整安装(约 10GB)。AGPL-3.0,约 4.8 万 star,仍在维护。

llama-cpp-python

llama-cpp-python

开源

llama.cpp 的官方 Python 绑定,让开发者用 Python 代码直接调用本地大模型。支持各类 GGUF 量化模型,CPU 即可运行、无需独立显卡,适合在自有项目里快速集成聊天机器人、RAG 知识库问答、数据分析助手等能力,也能与 LangChain、FastAPI 等生态配合。

AnythingLLM

AnythingLLM

开源

开源的本地 RAG 知识库工具,专注文档问答场景。上传 PDF、Word、Excel 等文档后,AI 即可基于这些内容回答问题;支持本地模型与云端模型多种接入方式,适合搭建企业知识库、个人学习助手,完全免费、可本地部署。

Jan

Jan

开源

开源的本地 AI 聊天客户端,支持 Windows、Mac、Linux 桌面端。一键下载 Llama、Qwen、DeepSeek 等开源模型,完全离线运行、数据不上传;界面简洁类似 ChatGPT,适合注重隐私、不想联网使用的个人用户。

Candle

Candle

开源

Hugging Face 官方出品的 Rust 机器学习推理框架,主打轻量和高性能。相比 Python 推理速度更快、内存占用更低,适合边缘设备与生产环境部署;支持 PyTorch 模型转换,部署简单,适合需要高性能推理又不想引入重型框架的场景。

Open WebUI

Open WebUI

开源

开源的本地 AI 聊天界面,类似 ChatGPT 的网页版但完全私有化。可接入 Ollama、OpenAI API、本地模型等多种后端,支持多用户、文件上传、知识库与 RAG,适合团队内部部署私有 AI 助手,数据不出本地、隐私安全。

LM Studio

LM Studio

开源

本地大模型桌面客户端,支持 Windows、Mac、Linux。一键从 Hugging Face 下载模型,界面友好类似 ChatGPT;内置本地 API 服务器,可为其他工具提供后端服务。完全免费,适合新手和开发者,是本地部署 LLM 的入门首选。

Cherry Studio

Cherry Studio

开源

开源的桌面端 AI 聊天客户端,支持同时接多个大模型(GPT、Claude、Gemini、本地模型等)。界面简洁美观,支持对话保存、文件上传、知识库。一个工具用遍所有 AI,不用在多个 App 之间切换。支持 Windows、Mac、Linux。

GPT4All

GPT4All

开源

Nomic AI 出品的开源本地大模型运行工具,主打一键下载即用。支持 Windows、Mac、Linux,内置了 Llama、Mistral、Phi 等各种开源模型。完全免费,离线可用,不需要联网。适合新手体验本地大模型,门槛最低。

Ollama

Ollama

开源

在本地运行开源大模型的常用工具,通过几条命令行指令即可拉取并启动模型,无需自行编译推理框架,支持 Llama、Qwen、DeepSeek 等主流开源系列,并对外提供 OpenAI 兼容接口,方便接入既有应用。适合想在自己电脑上跑模型、做隐私敏感任务或本地开发的用户。需要注意的是,本地运行的实际速度与可用参数量取决于显卡显存,硬件条件不足时建议选择量化版本或更小参数的模型。

PrivateGPT

PrivateGPT

开源

开源的企业文档问答框架,把本地文档切分并向量化后,由本地运行的大模型完成检索与回答,数据不出内网,适合对资料保密有要求的团队搭建内部知识库。支持常见文档格式与多种模型后端,代码开放便于按自身环境定制。需要注意的是,本地部署对硬件有一定要求,模型规模与显存、响应速度需要权衡;检索效果高度依赖文档切分策略与提示词设置,上线前建议用真实问题做效果评估与调优。

本地部署13 个工具

llama.cpp

llama.cpp

开源

C/C++ 写的本地大模型推理框架,GitHub 约 12.7 万 star,几乎每天有提交,是本地部署生态里最常用的推理后端之一。定位早已不限于 LLaMA 系列,官方示例直接用 Qwen,支持各类 GGUF 模型。后端覆盖 CUDA、HIP、Metal、Vulkan、SYCL、CANN、MUSA、WebGPU 甚至 RISC-V,支持 1.5-8bit 量化和 CPU+GPU 混合推理,自带 llama-cli、llama-server(OpenAI 兼容 API + 内置 Web UI)。适合用消费级显卡跑本地模型,也常被其他项目当作底层推理引擎。版本发得极勤,追具体版本号意义不大。

LocalAI

LocalAI

开源

用 Go 写的开源本地 AI 推理服务器,主打 OpenAI 兼容 API,可以直接替换掉依赖 OpenAI 接口的应用而不用改代码。官方称无需 GPU 也能跑 LLM、视觉、语音、图像、视频,最新版 v4.9.0(2026 年 8 月)改为默认拒绝式鉴权,新增端到端上下文压缩和 vllm-cpp 视频模态支持。MIT 协议,GitHub 约 4.9 万 star,仍在活跃维护。适合想在自有硬件上快速挂一个 OpenAI 风格接口的团队;覆盖面广但依赖后端组合,性能调优成本比单一用途框架高。

Text Generation WebUI

Text Generation WebUI

开源

本地大模型的桌面 / Web 操作界面,Gradio 界面跑在本地 7860 端口,是最老牌的本地模型前端之一。注意:项目仓库已更名为 oobabooga/textgen,是同一个项目的新名字。支持 llama.cpp、Transformers、ExLlamaV3、TensorRT-LLM 多种后端切换,含视觉、文档问答、工具调用与 MCP、LoRA 训练、图像生成,以及 OpenAI / Anthropic 兼容 API。便携版用 Electron 封装、解压即用,但仅支持 GGUF,完整功能需完整安装(约 10GB)。AGPL-3.0,约 4.8 万 star,仍在维护。

llama-cpp-python

llama-cpp-python

开源

llama.cpp 的官方 Python 绑定,让开发者用 Python 代码直接调用本地大模型。支持各类 GGUF 量化模型,CPU 即可运行、无需独立显卡,适合在自有项目里快速集成聊天机器人、RAG 知识库问答、数据分析助手等能力,也能与 LangChain、FastAPI 等生态配合。

AnythingLLM

AnythingLLM

开源

开源的本地 RAG 知识库工具,专注文档问答场景。上传 PDF、Word、Excel 等文档后,AI 即可基于这些内容回答问题;支持本地模型与云端模型多种接入方式,适合搭建企业知识库、个人学习助手,完全免费、可本地部署。

Jan

Jan

开源

开源的本地 AI 聊天客户端,支持 Windows、Mac、Linux 桌面端。一键下载 Llama、Qwen、DeepSeek 等开源模型,完全离线运行、数据不上传;界面简洁类似 ChatGPT,适合注重隐私、不想联网使用的个人用户。

Candle

Candle

开源

Hugging Face 官方出品的 Rust 机器学习推理框架,主打轻量和高性能。相比 Python 推理速度更快、内存占用更低,适合边缘设备与生产环境部署;支持 PyTorch 模型转换,部署简单,适合需要高性能推理又不想引入重型框架的场景。

Open WebUI

Open WebUI

开源

开源的本地 AI 聊天界面,类似 ChatGPT 的网页版但完全私有化。可接入 Ollama、OpenAI API、本地模型等多种后端,支持多用户、文件上传、知识库与 RAG,适合团队内部部署私有 AI 助手,数据不出本地、隐私安全。

LM Studio

LM Studio

开源

本地大模型桌面客户端,支持 Windows、Mac、Linux。一键从 Hugging Face 下载模型,界面友好类似 ChatGPT;内置本地 API 服务器,可为其他工具提供后端服务。完全免费,适合新手和开发者,是本地部署 LLM 的入门首选。

Cherry Studio

Cherry Studio

开源

开源的桌面端 AI 聊天客户端,支持同时接多个大模型(GPT、Claude、Gemini、本地模型等)。界面简洁美观,支持对话保存、文件上传、知识库。一个工具用遍所有 AI,不用在多个 App 之间切换。支持 Windows、Mac、Linux。

GPT4All

GPT4All

开源

Nomic AI 出品的开源本地大模型运行工具,主打一键下载即用。支持 Windows、Mac、Linux,内置了 Llama、Mistral、Phi 等各种开源模型。完全免费,离线可用,不需要联网。适合新手体验本地大模型,门槛最低。

Ollama

Ollama

开源

在本地运行开源大模型的常用工具,通过几条命令行指令即可拉取并启动模型,无需自行编译推理框架,支持 Llama、Qwen、DeepSeek 等主流开源系列,并对外提供 OpenAI 兼容接口,方便接入既有应用。适合想在自己电脑上跑模型、做隐私敏感任务或本地开发的用户。需要注意的是,本地运行的实际速度与可用参数量取决于显卡显存,硬件条件不足时建议选择量化版本或更小参数的模型。

PrivateGPT

PrivateGPT

开源

开源的企业文档问答框架,把本地文档切分并向量化后,由本地运行的大模型完成检索与回答,数据不出内网,适合对资料保密有要求的团队搭建内部知识库。支持常见文档格式与多种模型后端,代码开放便于按自身环境定制。需要注意的是,本地部署对硬件有一定要求,模型规模与显存、响应速度需要权衡;检索效果高度依赖文档切分策略与提示词设置,上线前建议用真实问题做效果评估与调优。