选本地模型时,经常要在同一台机器上横向对比好几个(Qwen、DeepSeek、Llama 系),也需要一个能把"本地 AI 长啥样"直观摆出来的界面。命令行一把梭太劝退,我们需要一个能看图、能点、能切换的界面——LM Studio 顺理成章成了第一选择。
但坑来得比想象快。下面是我们这台机器上的真实经历,不是文档摘要。
第一坑:显存会默默爆掉
我们主机是 RTX 5060 8G 显存 + i5-12600KF + 32G 内存。一开始图省事,直接拿 LM Studio 加载 Qwen3.6-35B-A3B(光权重就 21G)。结果显卡显存瞬间爆了,LM Studio 不报错,只是默默把整模型甩到 CPU 卸载——界面看着在跑,实际速度是"能演示但体验断崖",客户坐那等一个 token 蹦半天的尴尬你懂的。
经验:显存不够别硬刚大模型。LM Studio 不会弹窗告诉你"我在用 CPU 跑",它只是变慢。看到响应明显卡顿,先去任务管理器看显卡显存是不是已经 0 可用。
第二坑:端口被抢
LM Studio 自带 Local Server 默认走 1234 端口的 OpenAI 兼容接口,我们习惯用 Cherry Studio 当客户端连。问题是我们同时也在跑 llama.cpp 的 server,它默认也抢 1234。两个一开就互相打架,调了半天才理顺谁占了端口。
经验:开 Local Server 前先
netstat -ano | findstr 1234确认端口没被 Ollama / llama.cpp 占用。或两个服务各占各的端口,Cherry Studio 里配两个 OpenAI 端点分别指向它们。
我们的分工:LM Studio 只管"轻量体验"
踩完坑之后,我们把角色切清楚了:
- 大模型推理不让 LM Studio 扛:35B 那套交给 llama.cpp + Open WebUI(端口 8081),这才是生产级后端;
- LM Studio 只保留"小模型快速体验 + 客户端联调":7B Q4 这种小模型(约 4–5G)才放心丢进 8G 显卡;
- 35B 级别的 MoE 老老实实走 32G 内存的 CPU 推理:别指望实时对话的丝滑,但能跑、能验证想法。
实测结果(同一台机器)
| 场景 | 表现 |
|---|---|
| RTX 5060 8G + 7B Q4 | 流畅,适合现场快速出 demo |
| 32G 内存 + CPU + 35B-A3B MoE | 能跑(我们生产环境就是这套),别指望实时丝滑 |
| 一个界面切多个模型横向评测 | 效率比命令行高不少,这是 LM Studio 真正值钱的地方 |
给你避的坑(省流版)
- 显存不够别硬刚大模型,LM Studio 会默默全 CPU 卸载,体验断崖;
- 开 Local Server 前先确认端口没被 llama.cpp / Ollama 占用;
- 想真跑生产级大模型,图形界面只是入口,后端还是得 llama.cpp / llama-server 这类扛得住。
如果你也在消费级硬件上折腾本地模型,这篇可以和我们的另一篇《在一台消费级 Windows 主机上跑起 Qwen3.6-35B》对照着看——一篇讲"轻量体验怎么安排",一篇讲"生产级全栈怎么落地"。

