AI工具网 Logo
AI 工具网aigongjuwang.cn
全部工具AI 对话AI 写作AI 设计AI 视频漫剧制作AI 音频AI 编程本地部署MCP 插件AI 办公AI 开发AI 营销AI 学习
暗色模式

加载中...

粤ICP备2026107010号-2粤公网安备44196902000144号
AI 本地部署2026-08-31·3 分钟阅读

用 LM Studio 管理本地模型:我们在 RTX 5060 8G 上踩过的坑

LMStudio本地模型量化RTX5060llama.cpp

图形界面跑大模型不是不行,但在 8G 显存上硬刚 35B 会翻车。这篇是我们横向评测多个本地模型时的真实踩坑记录——哪些能放心丢给 LM Studio,哪些必须让位给命令行后端。

用 LM Studio 管理本地模型:我们在 RTX 5060 8G 上踩过的坑

选本地模型时,经常要在同一台机器上横向对比好几个(Qwen、DeepSeek、Llama 系),也需要一个能把"本地 AI 长啥样"直观摆出来的界面。命令行一把梭太劝退,我们需要一个能看图、能点、能切换的界面——LM Studio 顺理成章成了第一选择。

但坑来得比想象快。下面是我们这台机器上的真实经历,不是文档摘要。

第一坑:显存会默默爆掉

我们主机是 RTX 5060 8G 显存 + i5-12600KF + 32G 内存。一开始图省事,直接拿 LM Studio 加载 Qwen3.6-35B-A3B(光权重就 21G)。结果显卡显存瞬间爆了,LM Studio 不报错,只是默默把整模型甩到 CPU 卸载——界面看着在跑,实际速度是"能演示但体验断崖",客户坐那等一个 token 蹦半天的尴尬你懂的。

经验:显存不够别硬刚大模型。LM Studio 不会弹窗告诉你"我在用 CPU 跑",它只是变慢。看到响应明显卡顿,先去任务管理器看显卡显存是不是已经 0 可用。

第二坑:端口被抢

LM Studio 自带 Local Server 默认走 1234 端口的 OpenAI 兼容接口,我们习惯用 Cherry Studio 当客户端连。问题是我们同时也在跑 llama.cpp 的 server,它默认也抢 1234。两个一开就互相打架,调了半天才理顺谁占了端口。

经验:开 Local Server 前先 netstat -ano | findstr 1234 确认端口没被 Ollama / llama.cpp 占用。或两个服务各占各的端口,Cherry Studio 里配两个 OpenAI 端点分别指向它们。

我们的分工:LM Studio 只管"轻量体验"

踩完坑之后,我们把角色切清楚了:

  • 大模型推理不让 LM Studio 扛:35B 那套交给 llama.cpp + Open WebUI(端口 8081),这才是生产级后端;
  • LM Studio 只保留"小模型快速体验 + 客户端联调":7B Q4 这种小模型(约 4–5G)才放心丢进 8G 显卡;
  • 35B 级别的 MoE 老老实实走 32G 内存的 CPU 推理:别指望实时对话的丝滑,但能跑、能验证想法。

实测结果(同一台机器)

场景表现
RTX 5060 8G + 7B Q4流畅,适合现场快速出 demo
32G 内存 + CPU + 35B-A3B MoE能跑(我们生产环境就是这套),别指望实时丝滑
一个界面切多个模型横向评测效率比命令行高不少,这是 LM Studio 真正值钱的地方

给你避的坑(省流版)

  1. 显存不够别硬刚大模型,LM Studio 会默默全 CPU 卸载,体验断崖;
  2. 开 Local Server 前先确认端口没被 llama.cpp / Ollama 占用;
  3. 想真跑生产级大模型,图形界面只是入口,后端还是得 llama.cpp / llama-server 这类扛得住。

如果你也在消费级硬件上折腾本地模型,这篇可以和我们的另一篇《在一台消费级 Windows 主机上跑起 Qwen3.6-35B》对照着看——一篇讲"轻量体验怎么安排",一篇讲"生产级全栈怎么落地"。

相关阅读

AI 本地部署
在一台消费级 Windows 主机上跑起 Qwen3.6-35B:我们怎么做到的
2026-08-31
AI 聊天
2026 国内能直接用的 AI 聊天助手怎么选:DeepSeek、Kimi、通义、文心、豆包横评
2026-09-17
AI 视频
即梦AI(Seedance 2.0)完整使用指南:从入门到精通
2026-09-07