首页 /文章 /本地大模型三向实操指南

本地大模型三向实操指南

2026 本地 LLM 三大硬件方向实操: DGX Spark 双机 / RTX PRO 5000 48GB / M5 Mac, 含 VRAM 预算与买前 3 考

本地大模型DGX SparkRTX PRO 5000M5 Mac
分类:工程与基础设施 发布于 2026-09-21 49 次浏览

背景

本周 V2EX 论坛热度中 "本地大模型" 节点是近 7 天最热的话题类: 2 台 DGX Spark 跑满血 DeepSeek V4 Flash (66 回复) / RTX PRO 5000 48GB 跑 Qwen3.8 (55 回复) / Mac M5 统一内存讨论 (51 回复) —— 三帖聚焦同一问题。

本文把这三个方向整理成三张实操看板, 每张含 "买什么 + 跑什么 + 关键步骤 + 验证回显"; 不给完整脚本(论坛 / 科站 / B 站都有, 另行给指向链接), 只给整条通路的图示。

方向一: 2 台 DGX Spark 双机 (总显存 256GB)

跑什么: DeepSeek V4 Flash (参 284B / 权 150GB) / Qwen 3.8 Flash-Next (参 125B) / 多模型混跑

买什么: 2 台 DGX Spark (NVIDIA GB10 Blackwell 架构, 128GB 显存 + 100GB/s 带宽缓存型)

关键步骤(可复现):

  1. maliubiao / dgx-spark-2-deepseek-flash-0731 —— DGX Spark 双机跑 DeepSeek V4 Flash-0731 完整手册 (arm64 源码构建 / SSD 冷备 / 显存预算 / 双机自启 / 验证回滚)
  2. B 站视频 —— 2 台双机跑 DeepSeek V4 Flash 实测约 65 tokens/s (可作为验收参考)
  3. CSDN 实战 —— 128GB 统一内存上 DeepSeek-V4 流式推理, 含显存控制要点

方向二: RTX PRO 5000 48GB 单机最高性价比

跑什么: Qwen3.8-27B-FP8 / Qwen3.8-Flash-Next-NVFP4 (实测单卡 164.7 t/s) / 其他 27B-32B 闭源量化模型

买什么: 1 张 RTX PRO 5000 Blackwell (48GB 显存) + 高端 CPU + 64-128GB 系统内存 + NVMe SSD

实测信息: RTX PRO 5000 48GB 上 Qwen3.8-27B-FP8 可达 prefill 5000+ t/s (首 token 前的批量处理速度) , 加速参考:

  1. Reddit 复现(参考实验帖): 搜 "Qwen3.8-27B NVFP4" 进入 r/LocalLLaMA (热度 165); 粒帖仅给方向, 脚本自跑
  2. V2EX localLLM 节点入口 —— 近 7 天最热帖 "2 台 dgx-spark 部署满血 deepseek v4 flash 完全指南 (67 回复)" 与 "RTX PRO 5000 (或其他 48GB) Qwen3.8-27B-FP8 配置交流 (55 回复)", 内含完整实参
  3. HF: Qwen3.8-Flash-Next-NVFP4 权重 —— 写实 SGLang 实测 164.7 t/s; 大陆直连可能慢, 参考国内镜像
  4. Unsloth 实验文档 —— 1× RTX 6000 PRO 跑 Qwen 3.8 Flash-Next 提速到 170 tokens/s (含量化对比)

方向三: M5 Mac (Apple Silicon 统一内存 128GB-1.5TB)

跑什么: Qwen3.8-30B / DeepSeek 30B-40B / Llama 3.1 70B / 多模态 / ComfyUI 生图

买什么: M5 Pro / M5 Max MacBook Pro 或 Mac Studio (128GB-1.5TB 统一内存)

实操要点:

  1. Ollama macOS 客户端 —— v15 起 M5 / M5 Pro / M5 Max 受支持, 一行指令拉模型
  2. V2EX localLLM "mac m5 ultra" 贴 —— 附近原帖 "mac m5 ultra 中国官网 1.2T 显存带宽用 256GB 版 8.6 万 (51 回复)", 实参投票讨论硬件投资
  3. GitHub: ollama/ollama —— 完整仓库与 source 构建 (Mac / Win / Linux); 适合加入自今计算的大项目

注意: "统一内存" ≥ "显存" — M 系列跑 RAG / Agent 优势是长上下文 (128GB-1.5TB 可长 token), 但 token 生成速度比专业 GPU 慢 2-4X; 适合 "要长内存 + 不要快" 的场景 (如文档阅读 / 长故事生成 / 内部答疑)

通用件 3 项 (不绑硬件, 三向都能用)

  1. 模型拉槽: Ollama (一行指令拉模型); 可选 vLLM 高并发推理
  2. 低码管理台: Dify / Flowise 接上 Ollama / vLLM, 发布产品级 RAG + Agent
  3. 显存预算: ApXML VRAM 计算器 (RTX 5000 / 48GB / M5 科速对照)

买前 3 考 (超时刻坑线索)

  1. VRAM 预算: 权重 + KV Cache + 流式 buffer ≥ 70% 你 GPU 显存才能慢来; 留 30% 跑 RAG 数据 / 工作流
  2. 存储 I/O: 权重放 NVMe SSD (建议 2-10GB/s 通道); HDD / 网络盘不要 (模型加载太慢)
  3. 速度 vs 长内存: RTX PRO 5000 (48GB) 显存多快 / M5 (128GB-1.5TB) 长内存慢速 — 按自己应用选

合规

  • 长文 / 解释 / 实操教程只发资源 / 贴子, 不嵌入; 实参带字母, 避推荐市场推省硬件套餐
  • 自装权重要看 License (商用 / 二次分发等), 商业化前读原文
  • 硬件价格与实验值以官方与实际实参为准
关键词 本地大模型DGX SparkRTX PRO 5000M5 Mac 000017