AI工具网 Logo
AI · 工具网aigongjuwang.cn
全部工具AI编程工具AI 推理框架AI办公工具AI搜索工具AI 模型社区AI智能体AI 绘画设计AI聊天助手AI视频工具AI电商工具AI数据工具AI健康医疗AI社交媒体AI浏览器插件AI图像工具AI写作工具AI 3D建模AI翻译工具AI游戏开发AI音频工具AI提示词AI教育学习AI 本地部署工具AI 漫剧制作MCP 插件
暗色模式

加载中...

粤ICP备2026107010号-2粤公网安备44196902000144号

本地化部署 Qwen3.6-35B-A3B 全栈 AI 助手(消费级主机实战)

发布于 2026/8/11

案例类型:企业私有化 AI 大模型部署 部署单位:油兔工作室(东莞) 完成时间:2026 年 8 月 数据来源:实际部署环境实测记录


一、项目背景与需求

1.1 业务痛点

油兔工作室在业务运营中面临以下 AI 使用问题:

  • 数据安全顾虑:业务文档、客户资料、项目源码无法上传到公有云大模型,担心数据外泄
  • 依赖外部服务:使用云端 AI 受网络、额度、政策影响,不稳定且成本不可控
  • 场景不匹配:通用在线 AI 无法读取本地知识库、操作本地文件、执行本地命令
  • 定制化需求:需要符合自身业务(数字孪生、AI 漫剧、3D 可视化)的专业助手

1.2 核心需求

需求项说明
完全本地化数据不出本机,全程离线推理
知识库问答读取本地业务知识库,回答专业问题
工具调用读写文件、执行命令、搜索目录
语音交互语音输入 + 语音回答,拟人化体验
网页/3D 预览生成网页后本地实时预览

二、硬件环境

配置项规格
CPUIntel i5-12600KF @ 3.70GHz(12 核)
显卡NVIDIA RTX 5060 8GB 显存
内存32GB DDR4 3600MHz
硬盘1.35 TB NVMe SSD
系统Windows 64 位
显示器3440×1440 超宽带鱼屏

部署要点:本案例在 32GB 内存 + 8GB 显存的消费级主机上完成,无需专业服务器硬件。


三、方案架构

3.1 模型选型

选用阿里通义最新开源模型 Qwen3.6-35B-A3B(MoE 混合专家架构):

参数值
模型Qwen3.6-35B-A3B-APEX-MTP-I-Compact
架构MoE(总参数 35B,激活参数 3B)
量化格式GGUF(I-Compact 量化)
文件大小16.1 GB
上下文窗口64K tokens
推理引擎llama.cpp b10216
视觉模块mmproj-F16(支持图片理解)

选型理由:MoE 架构在 32GB 内存下可流畅运行;I-Compact 量化在保证能力的同时将模型压缩至 16GB,完美适配消费级硬件。

3.2 系统架构(8 个服务协同)

┌─────────────────────────────────────────────┐
│           一键启动(桌面图标 Start-35B)        │
├─────────────────────────────────────────────┤
│  35B 大模型推理      llama-server  :8081     │
│  Open WebUI 前端     web-ui       :3000     │
│  工具服务 Server     tool-server  :5010     │
│  SenseVoice 语音识别  stt         :5011     │
│  CosyVoice 语音合成  tts         :5012     │
│  Edge TTS 备用语音   edge-tts    :5005     │
│  静态预览服务         static      :8082     │
│  本地知识库           RAG(内置)            │
└─────────────────────────────────────────────┘

3.3 功能模块

模块实现方案说明
核心对话Qwen3.6-35B-A3B中文对话、代码、推理、写作
知识库 RAGOpen WebUI 内置 + MiniLM 向量检索53 篇业务文档,本地检索
工具调用自研 Tool Server(7 个工具)读文件/写文件/命令执行/搜索/截图/预览
语音输入SenseVoice(阿里开源)中文识别准确率高于 Whisper
语音输出CosyVoice(阿里云 API)拟人化情感音色
网页预览本地静态服务器 8082生成的 HTML 一键点击预览

四、安全与权限设计

4.1 目录权限白名单(核心安全设计)

目录读写执行用途
D:\项目✅✅✅AI 工作目录
D:\WorkBuddy✅✅✅日常协作
D:\Projects✅✅✅UE 项目源码
D:\MapData✅✅✅地图/3D 数据
D:\知识库✅❌ 403❌ 403只读保护
其他目录❌❌❌一律拒绝

安全亮点:

  • 知识库目录只读:模型可检索但禁止修改(工具层硬限制 403)
  • 白名单外目录全部拒绝访问
  • 命令执行有白名单(git/python/node 等)

4.2 数据隐私

  • 所有推理全程本地,数据不出主机
  • 对话、知识库、文件全部存储在本地磁盘
  • 无需注册任何云服务(语音识别本地化)

五、性能实测数据

指标实测值
推理速度(热缓存)42 tok/s
上下文窗口64K tokens
首 token 延迟244-473 ms
内存占用53%(16GB 模型)
长时间运行模型页被换出降至 21 tok/s,重启恢复

性能优化经验:

  1. MoE 架构(3B 激活)是 32GB 内存跑大模型的关键
  2. 关闭 MTP 推测解码(CPU offload 场景负优化)
  3. mmap 加载模式(避免内存 98% 爆炸)
  4. 每日重启一次保持满速

六、实际应用场景

6.1 知识库智能问答

"帮我查一下排错记录里 RTX5060 PyTorch 兼容性问题" → 35B 检索本地知识库,给出专业解答

6.2 工具型工作助理

"读取 D:\项目\网站 下的文件并预览" → 模型读取文件 → 本地静态服务器 → 一键点击预览网页

6.3 网页/3D 实时生成

"做一个 Three.js 3D 旋转卡片页面" → 35B 生成完整 HTML → 本地预览服务器打开可交互 3D 场景

6.4 语音对话(拟人化)

语音说"帮我读取项目目录" → SenseVoice 识别 → 35B 回答 → CosyVoice 情感音色朗读

6.5 项目开发辅助

"看看 D:\Projects 里 UE 插件代码" → 读取、分析、修改 D:\Projects 下的 UE 项目源码


七、部署成本

项目成本
硬件消费级主机(已有)
模型开源免费(Apache-2.0)
软件开源免费(llama.cpp / Open WebUI / SenseVoice)
语音合成CosyVoice API 按量(新用户免费额度)
总新增成本≈ 0 元(不含电费)

对比公有云:同能力云端 API 按调用计费,长期使用成本远高于本地部署;且数据安全完全可控。


八、部署步骤摘要(完整流程)

  1. 下载 Qwen3.6-35B-A3B GGUF 模型(魔塔 ModelScope,国内高速)
  2. 安装 llama.cpp(b10216)+ Open WebUI 0.11
  3. 部署 Tool Server(7 个工具 + 权限白名单)
  4. 部署 SenseVoice 语音识别(本地化)
  5. 配置 CosyVoice 语音合成(拟人音色)
  6. 配置本地知识库 RAG(53 篇文档)
  7. 编写一键启动脚本(8 个服务)
  8. 配置安全策略(只读目录、白名单)

九、案例总结

本项目在一台**消费级 Windows 主机(32GB 内存 + 8GB 显存)**上,完成了 Qwen3.6-35B-A3B 全栈本地化 AI 部署:

  • ✅ 完全离线:数据不出本机,隐私安全
  • ✅ 功能完整:对话、知识库、工具、语音、预览全打通
  • ✅ 性能可观:42 tok/s 流畅对话
  • ✅ 成本极低:软硬件零新增成本
  • ✅ 扩展性好:可随时更换模型、增加工具

适用场景:中小企业私有化 AI 助手、数据敏感行业(设计/开发/创作)、个人开发者本地工作台。


本案例基于油兔工作室实际部署环境记录整理,数据均来自实测。

Ollama

本地运行大模型的最简单、最流行工具,支持一键部署各种开源模型。