首页 /文章 /本地大模型入门指南 — DGX Spark / Mac M5 / RTX 5000

本地大模型入门指南 — DGX Spark / Mac M5 / RTX 5000

分类:工程与基础设施 发布于 2026-09-21 142 次浏览

为什么做这篇

目前主流的三类本地大模型硬件方案:

· DGX Spark 部署 DeepSeek v4 flash

· Mac M5 Ultra 256GB

· RTX PRO 5000 运行 Qwen3.8-27B-FP8

三种方案各有优劣。下表按显存、速度、成本三个维度列出差异。

一、三种硬件速查表

硬件 显存 / 内存带宽 价格 适合跑什么模型 注意事项
NVIDIA DGX Spark 128GB 统一内存 / 1.5TB/s 带宽 $3999 / 套(阶梯价)。 DeepSeek v4 flash(满血 60-70 tok/s)、Qwen3.8-27B(8B 量化) PCIe 占用,Ubuntu 22.04 重新拷机
Apple Mac M5 Ultra 256GB 统一内存 / ~1.1TB/s 带宽 ¥55,000 / 套↑ Qwen3.8-27B(全精度)、Llama 4-70B(4-bit) macOS + MLX 栈,跨平台迁移成本高
NVIDIA RTX PRO 5000 48GB 显存 / ~1.7TB/s 带宽 ~$4500 / 套(本地采购) Qwen3.8-27B(8B 量化, prefill 5000+t/s,decode 60+t/s) 48GB 不够 70B,适合 27B-32B 量化
选择指南追求"满血满速": DGX Spark。
追求"全精度 70B": Mac M5 Ultra。
追求"性价比 + 现存量": RTX PRO 5000(已有显卡直接加卡)。

二、部署步骤(DGX Spark 为例)

以下命令都可直接复制粘贴,按顺序跑就行:

1. 装 Ollama(本地模型引擎)

curl -fsSL https://ollama.com/install.sh | sh
# 验证
ollama --version

2. 拉模型

# 全精度 Qwen3.8-27B(约 65GB 显存/内存)
ollama pull qwen3.8:27b

# 或者 DeepSeek v4 flash(满血,两台 DGX Spark)
ollama pull deepseek-r1:67b

3. 跑起来

ollama run qwen3.8:27b

# 测试
» 你好,你是什么模型?

4. 装 open-webui(可选,加 Web UI)

docker pull ghcr.io/open-webui/open-webui:latest
docker run -d -p 3000:8080 --name open-webui \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:latest
# 打开 http://localhost:3000

5. 进阶:加 RAG(用 Dify 或 Flowise)

docker pull langgenius/dify-dify-api  # 或 flowiseai/flowise
docker run -d -p 3001:3000 \
  -e DB_USERNAME=dify -e DB_PASSWORD=dify \
  --name dify \
  langgenius/dify-dify-api
# 在 Dify 里填 Ollama http://host.docker.internal:11434

三、Mac M5 的替换步骤

Mac 上不装 Ollama(性能损失 30-40%),直接装 MLX:

brew install mlx
git clone https://github.com/ml-explore/mlx-lm
cd mlx-lm
pip install -e .
mlx_lm generate --model mlx-community/Qwen3.8-27B

或使用 OpenClaw 自带的本地模型支持。

Mac 的主要限制在于 MLX 生态与跨平台迁移,而非单一推理引擎。若主要在 Windows 环境下使用,Mac M5 的跨平台特性并不适用。

四、性能预期(实测数据)

硬件 × 模型 Prefill (tok/s) Decode (tok/s) 来源
DGX Spark × DeepSeek v4 flash ~3500 60-70 社区实测
RTX PRO 5000 × Qwen3.8-27B-FP8 5000+ 60+ 社区实测
Mac M5 Ultra × Qwen3.8-27B ~1200 ~45 社区估算(MLX 实测差异 ±20%)
注意: 这些数字是"单机单模型"的预填/解码速度。如果你要做 70B 多模态 + RAG,速度还会受 GPU 数量 / 显存带宽影响。

五、本地部署的组合方案

命令行环境

Aider(本地推理)+ open-webui(RAG + UI),完全本地,不花一分钱。

VS Code 环境

Cline + 本地 Ollama + qwen3.8-27b,VS Code 里直接调用。

全自动任务

OpenHands 派任务,itchy 看结果,本地用 open-webui 备用。

三种路线共用同一个底座(Ollama / MLX + 本地模型),区别只在"前端界面"。你可以今天先用 命令行环境路径搭好,明天再装 IDE 插件,不冲突。

六、常见问题清单

1. Docker 卷覆盖 改了容器内代码,重启发现被卷覆盖。改文件先查是不是 bind mount。

2. Ollama 默认 8B 量化 默认 ollama pull qwen3.8:27b 是 8B 量化,不是 27B 全精度。要用 qwen3.8:27b-Q8_0 或自己下载 GGUF。

3. RTX PRO 5000 48GB 不够 70B 70B-FP16 会直接 OOM。70B 必量化,27B 以内才直接跑。

4. Mac M5 的"统一内存"限制 带宽高(1.1TB/s),但受 SoC 限制,跑 70B 全精度时 CPU/GPU 切换损耗明显。27B 量化是 Mac 的甜点区。

关键词 000014