DeepSeek V4 Flash 能在本地跑了,但 32GB 内存先别折腾

AI 摘要

Unsloth 公布 DeepSeek V4 Flash 0731 的 GGUF 量化版本,284B 总参数、13B 激活、1M 上下文。Terminal Bench 2.1 从 61.8 拉到 82.7,DeepSWE 从 7.3 拉到 54.4。110GB 是底线,128GB 起步能跑稳,192GB 起选 UD-Q8_K_XL。

2026-08-07·出海情报站·阅读需5分钟

DeepSeek V4 Flash 正式版发布的头一两个小时,DeepSeek 响应速度明显变慢——几乎可以肯定所有人都在接入 API 测试。这个版本把 V4-Pro Preview 都给秒了,Agent 能力大幅增强。但比起 API,更让独立开发者兴奋的是:Unsloth AI 公布了本地跑的 GGUF 版本。

284B 总参数、13B 激活、1M 上下文的 DeepSeek V4 Flash 0731,现在可以通过 Unsloth Studio 或 llama.cpp 跑在自己的机器上。听起来很爽,但仔细看官方配置就会发现「本地」这两个字比很多人想的门槛高。

这个本地不是普通电脑的本地

官方给的底线是 110GB 总内存,想跑得比较靠谱建议从 128GB 起步。32GB、64GB 的普通电脑先不折腾。这里的总内存是系统 RAM 加显存,或者 Mac 的统一内存。

还有一个容易踩的坑:模型文件只有 103GB,不代表 103GB 内存就能跑。模型加载之后,KV Cache、上下文和系统还得继续占内存。官方底线 110GB,但按 128GB 来算比较省事。

Unsloth 原帖把 4-bit 写成了 lossless,当前文档标得更清楚:UD-Q4_K_XL 是 near-lossless,真正无损的是 UD-Q8_K_XL——两者只差 7GB。128GB 机器选 UD-IQ3_XXS,192GB 或 256GB 机器直接上 UD-Q8_K_XL,64GB 的先用 API 或者等更小的量化版本。

Agent 基准大幅提升

V4 Flash 正式版的 Agent 能力比 Preview 提升很多。官方给出 9 项 Agent 基准测试中,它把前身 Flash Preview 和参数更大的 V4-Pro Preview 都给秒了:Terminal Bench 2.1 从 61.8 涨到 82.7,DeepSWE 从 7.3 涨到 54.4。

本地跑这件事的真正价值不在「我能跑大模型」,而在「我能在自己硬件上跑一个接近顶级闭源能力的 agent」。对成本敏感或合规要求高的团队,这是从 0 到 1 的本地化路径。

两条上手路线

省事路线是 Unsloth Studio。Mac、Linux 和 WSL 打开终端跑官方命令,Windows 用 PowerShell,然后在浏览器打开。第一次启动会让你创建密码,进入 Model hub 搜索 DeepSeek-V4-Flash-0731-GGUF,按自己的内存选量化版本点 Download。下载量在 100GB 到 162GB 之间,建议提前留足硬盘空间。

已经在用 llama.cpp 的人,先保证版本是最新的,然后直接从 Hugging Face 拉模型。128GB 机器可以从 3-bit 开始:内存够想跑官方无损版,把模型名换掉。如果下载老卡住,可以先装 huggingface_hub,手动把 3-bit 文件下到本地。

建议第一次只开 32K 上下文,确认模型、速度和内存都正常,再往上加上下文。它虽然支持 1M 上下文,但上下文越长额外占用越大。

出海独立开发者的取舍

本地跑意味着三件事:第一,单次推理边际成本趋近于零,电费之外几乎不花钱;第二,所有数据不出本地,对企业合规友好;第三,硬件门槛决定了它适合工作站和大内存 Mac。

对真在犹豫要不要买 Mac Studio 或者加内存的独立开发者来说,V4 Flash 本地版的出现让「要不要做私有化部署」这道选择题多了一个明确的答案。32GB 丐版继续等更小量化版本,128GB 工作站现在就能跑得起来。

来源:掘金