适用场景:无独显服务器、老电脑本地推理。
工作流:
- 编译或下载 llama.cpp(纯 CPU 可运行)
- 下载 GGUF 量化模型(如 Qwen2.5-7B-Q4)
- 命令行 main -m model.gguf 启动推理
- 用 llama-server 提供 OpenAI 兼容 HTTP 接口
效果:2GB 内存机器也能跑 7B 量化模型,工作室测试环境、无 GPU 云服务器上的首选推理引擎。
进阶技巧:
- GGUF 格式可在 CPU/GPU 间灵活切换(--ngl 参数控制 GPU 层数)
- llama-server 提供 OpenAI 兼容接口,供其他程序调用
- 配合 ollama 生态,Windows 下也有完整工具链
实测:2 核 4G 云服务器可跑 Qwen2.5-7B-Q4(生成速度约 5-10 token/s),满足开发调试场景。