本地大模型入门指南 — DGX Spark / Mac M5 / RTX 5000
分类:工程与基础设施
发布于 2026-09-21
142 次浏览
为什么做这篇
目前主流的三类本地大模型硬件方案:
· DGX Spark 部署 DeepSeek v4 flash
· Mac M5 Ultra 256GB
· RTX PRO 5000 运行 Qwen3.8-27B-FP8
三种方案各有优劣。下表按显存、速度、成本三个维度列出差异。
一、三种硬件速查表
| 硬件 | 显存 / 内存带宽 | 价格 | 适合跑什么模型 | 注意事项 |
|---|---|---|---|---|
| NVIDIA DGX Spark | 128GB 统一内存 / 1.5TB/s 带宽 | $3999 / 套(阶梯价)。 | DeepSeek v4 flash(满血 60-70 tok/s)、Qwen3.8-27B(8B 量化) | PCIe 占用,Ubuntu 22.04 重新拷机 |
| Apple Mac M5 Ultra | 256GB 统一内存 / ~1.1TB/s 带宽 | ¥55,000 / 套↑ | Qwen3.8-27B(全精度)、Llama 4-70B(4-bit) | macOS + MLX 栈,跨平台迁移成本高 |
| NVIDIA RTX PRO 5000 | 48GB 显存 / ~1.7TB/s 带宽 | ~$4500 / 套(本地采购) | Qwen3.8-27B(8B 量化, prefill 5000+t/s,decode 60+t/s) | 48GB 不够 70B,适合 27B-32B 量化 |
选择指南追求"满血满速": DGX Spark。
追求"全精度 70B": Mac M5 Ultra。
追求"性价比 + 现存量": RTX PRO 5000(已有显卡直接加卡)。
二、部署步骤(DGX Spark 为例)
以下命令都可直接复制粘贴,按顺序跑就行:
1. 装 Ollama(本地模型引擎)
curl -fsSL https://ollama.com/install.sh | sh # 验证 ollama --version
2. 拉模型
# 全精度 Qwen3.8-27B(约 65GB 显存/内存) ollama pull qwen3.8:27b # 或者 DeepSeek v4 flash(满血,两台 DGX Spark) ollama pull deepseek-r1:67b
3. 跑起来
ollama run qwen3.8:27b # 测试 » 你好,你是什么模型?
4. 装 open-webui(可选,加 Web UI)
docker pull ghcr.io/open-webui/open-webui:latest docker run -d -p 3000:8080 --name open-webui \ -v open-webui:/app/backend/data \ ghcr.io/open-webui/open-webui:latest # 打开 http://localhost:3000
5. 进阶:加 RAG(用 Dify 或 Flowise)
docker pull langgenius/dify-dify-api # 或 flowiseai/flowise docker run -d -p 3001:3000 \ -e DB_USERNAME=dify -e DB_PASSWORD=dify \ --name dify \ langgenius/dify-dify-api # 在 Dify 里填 Ollama http://host.docker.internal:11434
三、Mac M5 的替换步骤
Mac 上不装 Ollama(性能损失 30-40%),直接装 MLX:
brew install mlx git clone https://github.com/ml-explore/mlx-lm cd mlx-lm pip install -e . mlx_lm generate --model mlx-community/Qwen3.8-27B
或使用 OpenClaw 自带的本地模型支持。
Mac 的主要限制在于 MLX 生态与跨平台迁移,而非单一推理引擎。若主要在 Windows 环境下使用,Mac M5 的跨平台特性并不适用。
四、性能预期(实测数据)
硬件 × 模型
Prefill (tok/s)
Decode (tok/s)
来源
DGX Spark × DeepSeek v4 flash
~3500
60-70
社区实测
RTX PRO 5000 × Qwen3.8-27B-FP8
5000+
60+
社区实测
Mac M5 Ultra × Qwen3.8-27B
~1200
~45
社区估算(MLX 实测差异 ±20%)
注意: 这些数字是"单机单模型"的预填/解码速度。如果你要做 70B 多模态 + RAG,速度还会受 GPU 数量 / 显存带宽影响。
| 硬件 × 模型 | Prefill (tok/s) | Decode (tok/s) | 来源 |
|---|---|---|---|
| DGX Spark × DeepSeek v4 flash | ~3500 | 60-70 | 社区实测 |
| RTX PRO 5000 × Qwen3.8-27B-FP8 | 5000+ | 60+ | 社区实测 |
| Mac M5 Ultra × Qwen3.8-27B | ~1200 | ~45 | 社区估算(MLX 实测差异 ±20%) |
五、本地部署的组合方案
命令行环境
Aider(本地推理)+ open-webui(RAG + UI),完全本地,不花一分钱。
VS Code 环境
Cline + 本地 Ollama + qwen3.8-27b,VS Code 里直接调用。
全自动任务
OpenHands 派任务,itchy 看结果,本地用 open-webui 备用。
三种路线共用同一个底座(Ollama / MLX + 本地模型),区别只在"前端界面"。你可以今天先用 命令行环境路径搭好,明天再装 IDE 插件,不冲突。
六、常见问题清单
1. Docker 卷覆盖 改了容器内代码,重启发现被卷覆盖。改文件先查是不是 bind mount。
2. Ollama 默认 8B 量化 默认 ollama pull qwen3.8:27b 是 8B 量化,不是 27B 全精度。要用 qwen3.8:27b-Q8_0 或自己下载 GGUF。
3. RTX PRO 5000 48GB 不够 70B 70B-FP16 会直接 OOM。70B 必量化,27B 以内才直接跑。
4. Mac M5 的"统一内存"限制 带宽高(1.1TB/s),但受 SoC 限制,跑 70B 全精度时 CPU/GPU 切换损耗明显。27B 量化是 Mac 的甜点区。
关键词
000014