加载中...
案例类型:企业私有化 AI 大模型部署 部署单位:油兔工作室(东莞) 完成时间:2026 年 8 月 数据来源:实际部署环境实测记录
油兔工作室在业务运营中面临以下 AI 使用问题:
| 需求项 | 说明 |
|---|---|
| 完全本地化 | 数据不出本机,全程离线推理 |
| 知识库问答 | 读取本地业务知识库,回答专业问题 |
| 工具调用 | 读写文件、执行命令、搜索目录 |
| 语音交互 | 语音输入 + 语音回答,拟人化体验 |
| 网页/3D 预览 | 生成网页后本地实时预览 |
| 配置项 | 规格 |
|---|---|
| CPU | Intel i5-12600KF @ 3.70GHz(12 核) |
| 显卡 | NVIDIA RTX 5060 8GB 显存 |
| 内存 | 32GB DDR4 3600MHz |
| 硬盘 | 1.35 TB NVMe SSD |
| 系统 | Windows 64 位 |
| 显示器 | 3440×1440 超宽带鱼屏 |
部署要点:本案例在 32GB 内存 + 8GB 显存的消费级主机上完成,无需专业服务器硬件。
选用阿里通义最新开源模型 Qwen3.6-35B-A3B(MoE 混合专家架构):
| 参数 | 值 |
|---|---|
| 模型 | Qwen3.6-35B-A3B-APEX-MTP-I-Compact |
| 架构 | MoE(总参数 35B,激活参数 3B) |
| 量化格式 | GGUF(I-Compact 量化) |
| 文件大小 | 16.1 GB |
| 上下文窗口 | 64K tokens |
| 推理引擎 | llama.cpp b10216 |
| 视觉模块 | mmproj-F16(支持图片理解) |
选型理由:MoE 架构在 32GB 内存下可流畅运行;I-Compact 量化在保证能力的同时将模型压缩至 16GB,完美适配消费级硬件。
┌─────────────────────────────────────────────┐
│ 一键启动(桌面图标 Start-35B) │
├─────────────────────────────────────────────┤
│ 35B 大模型推理 llama-server :8081 │
│ Open WebUI 前端 web-ui :3000 │
│ 工具服务 Server tool-server :5010 │
│ SenseVoice 语音识别 stt :5011 │
│ CosyVoice 语音合成 tts :5012 │
│ Edge TTS 备用语音 edge-tts :5005 │
│ 静态预览服务 static :8082 │
│ 本地知识库 RAG(内置) │
└─────────────────────────────────────────────┘
| 模块 | 实现方案 | 说明 |
|---|---|---|
| 核心对话 | Qwen3.6-35B-A3B | 中文对话、代码、推理、写作 |
| 知识库 RAG | Open WebUI 内置 + MiniLM 向量检索 | 53 篇业务文档,本地检索 |
| 工具调用 | 自研 Tool Server(7 个工具) | 读文件/写文件/命令执行/搜索/截图/预览 |
| 语音输入 | SenseVoice(阿里开源) | 中文识别准确率高于 Whisper |
| 语音输出 | CosyVoice(阿里云 API) | 拟人化情感音色 |
| 网页预览 | 本地静态服务器 8082 | 生成的 HTML 一键点击预览 |
| 目录 | 读 | 写 | 执行 | 用途 |
|---|---|---|---|---|
| D:\项目 | ✅ | ✅ | ✅ | AI 工作目录 |
| D:\WorkBuddy | ✅ | ✅ | ✅ | 日常协作 |
| D:\Projects | ✅ | ✅ | ✅ | UE 项目源码 |
| D:\MapData | ✅ | ✅ | ✅ | 地图/3D 数据 |
| D:\知识库 | ✅ | ❌ 403 | ❌ 403 | 只读保护 |
| 其他目录 | ❌ | ❌ | ❌ | 一律拒绝 |
安全亮点:
| 指标 | 实测值 |
|---|---|
| 推理速度(热缓存) | 42 tok/s |
| 上下文窗口 | 64K tokens |
| 首 token 延迟 | 244-473 ms |
| 内存占用 | 53%(16GB 模型) |
| 长时间运行 | 模型页被换出降至 21 tok/s,重启恢复 |
性能优化经验:
"帮我查一下排错记录里 RTX5060 PyTorch 兼容性问题" → 35B 检索本地知识库,给出专业解答
"读取 D:\项目\网站 下的文件并预览" → 模型读取文件 → 本地静态服务器 → 一键点击预览网页
"做一个 Three.js 3D 旋转卡片页面" → 35B 生成完整 HTML → 本地预览服务器打开可交互 3D 场景
语音说"帮我读取项目目录" → SenseVoice 识别 → 35B 回答 → CosyVoice 情感音色朗读
"看看 D:\Projects 里 UE 插件代码" → 读取、分析、修改 D:\Projects 下的 UE 项目源码
| 项目 | 成本 |
|---|---|
| 硬件 | 消费级主机(已有) |
| 模型 | 开源免费(Apache-2.0) |
| 软件 | 开源免费(llama.cpp / Open WebUI / SenseVoice) |
| 语音合成 | CosyVoice API 按量(新用户免费额度) |
| 总新增成本 | ≈ 0 元(不含电费) |
对比公有云:同能力云端 API 按调用计费,长期使用成本远高于本地部署;且数据安全完全可控。
本项目在一台**消费级 Windows 主机(32GB 内存 + 8GB 显存)**上,完成了 Qwen3.6-35B-A3B 全栈本地化 AI 部署:
适用场景:中小企业私有化 AI 助手、数据敏感行业(设计/开发/创作)、个人开发者本地工作台。
本案例基于油兔工作室实际部署环境记录整理,数据均来自实测。