8 GB 显存也能跑本地 AI:Windows 与 Mac 怎么选?

8 GB 显存也能跑本地 AI:Windows 与 Mac 怎么选?

2026/09/0414 分钟
分类:技术分享
标签:#AI#本地部署#自制软件#LocalBrain

摘要 Windows 负责把 NVIDIA 显卡变成本地文本代理,Mac 负责用统一内存承接更大模型和完整多媒体链。两边不是谁取代谁,而是两套不同的本地 AI 解法。 2026-09-04·黑粉科技

8 GB 显存也能跑本地 AI:Windows 与 Mac 怎么选?

8 GB NVIDIA 显卡与大内存 Mac 是两条不同的本地 AI 路线:左侧标题、本人视线和两类设备共同指向本地计算核心

昨晚我把 LocalBrain 装到了自己的 Windows 笔记本上——RTX 4070 Laptop,8 GB 显存,驱动 546.26。模型起来了,显卡也认了,然后我发了第一条「你好」,得到一整条红字。

先说结论:**三个系统里,macOS 是完整版,Windows 从这一版起有了「本地文本模型 + 全部本地工具」,Linux 还没有安装包。**Windows 这版没有自动更新,也没有代码签名。下面把每一条的原因,连同那三次翻车,一并写清楚。

▍三个系统现在各是什么状况

系统 版本 有什么 没有什么
macOS 13+,Apple Silicon 1.2.49 正式版 本地文本模型(MLX 与 llama.cpp)、语音转写、语音合成、图像、视频、音乐、全部本地工具、应用内自动更新
Windows 10/11 x64,NVIDIA 显卡 1.2.50 预览版 本地文本模型(llama.cpp CUDA)、全部本地工具(文档、联网、系统文件、网页自检)、对话与代理循环 语音、图像、视频、音乐;自动更新;代码签名
Linux 全部

Windows 版安装包 3.4 MB,装到当前用户目录,不要求管理员权限。

GitHub 官方发布页已经列出 Windows 10/11、NVIDIA 驱动门槛、8 GB 显存适用范围和当前限制;这张图是发布证据,不是界面示意图

Windows 缺的那一半不是「还没来得及做」,是做不了:语音转写、语音合成、图像、视频、音乐这五个后端全部跑在 Apple 的 mlx 上,Windows 上没有对应的东西可以启动。所以我选择把这些入口整块不显示,而不是留一排灰掉的、点了报错的按钮。

能跑的这一半,Windows 和 macOS 用的是同一套代码:上下文窗口怎么推、工具调用怎么循环、写文件失败怎么抢救,两边一个字不差。分叉只在两件事上:硬件怎么读,运行时从哪下。

为什么现在做 Windows 版,数字先说:Steam 2026 年 7 月的硬件调查里,8 GB 显存占 25.3%,单卡榜前列的 RTX 4060 笔记本和桌面版都是 8 GB——这是想在本机跑模型的人里最大的一群,而 LocalBrain 之前只能在 Apple Silicon 上跑。钱的流向也说清楚,谁在赚:显卡厂商赚的是你换更大显存的那次升级,所以它没有动机告诉你 8 GB 的卡就能把 8B 模型整卡跑满;托管模型的平台赚流量,模型本身免费;我这一端不赚——LocalBrain 没有收费版也没有内购,模型和推理引擎都从公开仓库直接下载到你的机器上,这条链上没有任何一个我能收钱的位置。你亏的是电费、硬盘和一次 640 MB 的下载。代价落在我这边:手里只有一张 8 GB 的卡,这周才第一次有一台 Windows 机器,所以 8 GB 这一档是实测,往上都是推导。

▍8 GB 显存到底能跑什么

Mac 上只有一笔账:统一内存,模型和系统抢同一池子。Windows 独显是两笔账:权重和 KV 缓存要挤进显存,塞不下的部分退到系统内存跑,速度掉四五倍。所以 Windows 版启动模型前先算一次「权重放哪」,再用同一次计算结果推上下文窗口和显卡层数——两个数必须来自同一次计算,否则会出现按整卡算了窗口、实际只卸载了一半层这种自相矛盾的启动参数。

  • 整卡:权重加最小 KV 装得下,全部层上显卡,这是 8 GB 卡的主战场;
  • MoE 专家放内存:塞不下但模型是 MoE、系统内存不少于权重的 1.2 倍,专家权重去内存、注意力留显卡,质量按大模型走,速度受内存带宽限制;
  • 部分卸载:以上都不成立时按每层体积算能塞几层,剩下的在 CPU 上跑,慢,卡片上如实写。

这里没有任何写死的「8 GB 专用」数字:显存留 1 GB 给显示和驱动、0.5 GB 给计算缓冲,剩下的按模型自带的 KV 成本推窗口。做完 8 GB,12、16、24 GB 的卡自动放宽。我这台机器上实测两款:

模型 体积 窗口 显存占用 速度
Granite 4.0 H Micro Q4_K_M 1.94 GB 32K 3.5 GB(含桌面自身 1.1 GB) 73.9 token/s
Gemma 4 E4B Q4_K_M 4.98 GB 55K(56,320) 4.9 GB 约 60.8 token/s

RTX 4070 Laptop 8 GB,驱动 546.26,KV 缓存 q8_0,llama.cpp b10705 CUDA 12.4 版。

同一台 8 GB Windows 笔记本的两款模型实测:73.9 与约 60.8 token/s;图表由本文实测记录整理,不是跨设备排行榜

驱动这件事顺便说一句。llama.cpp 的 CUDA 12.4 包,按 12.4 自己的要求得 551.61 以上的驱动;但早在 CUDA 11 就有了次版本兼容,12.x 编出来的程序只要驱动支持 12.0 就能跑,Windows 上的门槛是 527.41。我的 546.26 实测直接认出显卡,8187 MiB。所以软件的判定线画在 527.41——按 551.61 判会把一大批还能正常跑的机器误判成不可用。没有 NVIDIA 显卡或者驱动太旧,它会改装纯 CPU 版,并把为什么这么选写在安装进度里。

模型目录我没有按自己这张 8 GB 卡裁剪。新加了四款 8 GB 档:Qwen3 8B、Gemma 4 E4B、Granite 4.0 H Micro、Qwen3.6 35B-A3B;原来那些 27B、30B 的条目全部保留,卡片按你的机器写它会走哪条路。35B-A3B 是 MoE,21.79 GB 塞不进任何消费级显卡,但只要系统内存有 27 GB 以上,专家权重放内存就能跑。量化档位默认选本机显存扛得住的最高一档,24 GB 的卡会自动落到 Q5 或 Q6,不用改任何设置。这些大显存条目我自己没法测——我只有这一张 8 GB 的卡——推导链有单元测试守着,但实机数据得靠用更大显卡的人反馈。这和上一次把 85 GB 的 Qwen3.8 Flash Next 塞进 64 GB Mac 是同一个思路:那次靠的是把 N-gram 表留在固态硬盘,这次靠的是把专家权重留在内存——都是先弄清哪部分权重必须常驻,再决定其余的放哪。

▍同一件事,Windows 与 Mac 各擅长什么

如果目标是“让本地模型替我干活”,Windows 的优势是现成 NVIDIA 显卡:8 GB 档已经能把 8B 级量化模型整卡跑起来,再接上联网、文件和文档工具。代价是显存和内存分成两笔账,大模型一旦需要部分卸载,速度会明显下去。

Mac 的优势不是某个单项跑分,而是统一内存和完整工作流。模型、KV 缓存与系统共享同一池内存,64 GB 机器可以把远大于消费级显存容量的模型留在本机;同一套环境里还能继续做转写、配音、生图、视频和音乐。下面这张实拍里,一颗约占 51 GB 的 GGUF 模型正在 64 GB M5 Pro 上运行,系统仍然能明确显示模型与系统各自占了多少。

Mac 端把统一内存分成系统与 AI 模型两笔显示;当前有一颗约占 51 GB 的 GGUF 模型在本机运行

真正决定体验的是“模型之后能做什么”。Windows 首版已经有文档、联网、系统文件和网页自检;Mac 目前还多出语音、图像、视频与音乐的本地运行环境。因此:只做文字代理、代码与资料处理,优先看你手上的 NVIDIA 显卡;要把听、说、看和生成都留在一台机器,Apple Silicon 的完整链更合适。

Mac 的设置页把本地系统工具、文字与语音、GGUF、视频、图像、音乐等运行环境集中管理;这部分目前不是 Windows 首版的能力

▍装机第一天翻的三次车

回到开头那条红字。这一版是我在自己机器上从零装的,三次失败都发生在装完之后的头一个小时里,全是「在开发机上永远撞不到」的那种。

**第一次(22:11)。**我只装了 GGUF 推理引擎就去聊天——llama.cpp 本来就不需要 Python,Windows 上这会是常态。结果每一轮对话都去拉起七个本地工具的子进程,其中四个(tts、whisper、image、video)在 Windows 上根本没有后端,全部失败之后,聊天把这些失败原样堆成一条红字。两个问题:工具名单是一张静态的七项表,没按平台裁;工具全部不可用时,对话本身跟着一起死了。修法是名单按平台分成两份,Windows 只留文档、联网、系统三个;工具环境没装时退回普通对话,并提示到设置里装。

**第二次(22:44)。**装上修好的包,再发「你好」,红字换了一行:不允许发现未知 MCP 服务 tts。原因是前端把七项全集显式传给了后端,而我只在「不传列表」的默认路径上裁了名单——修的地方和请求进入的地方不是同一处,测的时候也只测了默认参数。现在两层各守一道:前端按平台取名单,后端对「白名单里有、本平台没有后端」的服务直接跳过;白名单之外的名字仍然拒绝,那是防执行任意模块的安全线,不能放松。

**第三次(06:35)。**工具环境装好了,模型也回答说自己能联网,我让它搜今天十条 AI 新闻,51 秒后所有搜索引擎全部失败。我直接调用那个联网工具复现:带代理环境变量 1.7 秒出结果,不带则海外引擎全部超时、另外三家国内引擎报「系统找不到指定的文件」。根因是从开始菜单启动的程序没有代理环境变量——Windows 上多数代理客户端只设系统代理,不设环境变量,而联网工具只认环境变量和一张探测端口表;另外它找 curl 的路径写死了 macOS 的位置。修完之后不带任何环境变量,从注册表读到系统代理,2.6 秒出结果。

这三次里最值得记的是第三次的验证方法:我的开发环境里一直有代理变量,在那里跑联网永远是通的,假绿。验证 Windows 联网功能必须把环境变量全部去掉再跑。

▍为什么 Windows 没有自动更新,Linux 没有包

更新包必须用一把离线私钥签名,客户端拿内置公钥验签通过才肯装。这把私钥在我的 Mac 上,纪律是不上 CI;而 Tauri 不支持从 macOS 交叉编译 Windows 包。两条合起来,Windows 包出在 Windows 机器上,私钥在 Mac 上,谁也够不着谁。这一版 Windows 因此没有更新器签名,「检查更新」会一直显示失败,新版本得回下载页手动装。这堵墙上一次是昨天在黑粉盒子那篇里撞的:同一把私钥纪律、同一条交叉编译限制,结论没有变。

还有一条更隐蔽的限制:Tauri 的静态更新清单只有一个顶层版本号,所有平台共用。两个平台停在不同版本这件事,在这个格式里表达不出来——只抬版本号会让另一个平台反复下载到旧包。所以这次 Windows 的 1.2.50 发成了预发布,macOS 的正式版仍然停在 1.2.49;等 Mac 那边也发 1.2.50,两条平台记录才能合进同一份清单。我给合并清单的脚本加了一道闸:两端版本不一致就拒绝生成。

Linux 没有包,原因和黑粉盒子不一样。黑粉盒子本质是个路由器,三个系统上跑的是同一段网络代码;LocalBrain 要在本机拉起模型运行时,每个平台都是一整套下载、解压、驱动检测和显存规划的真实测试。代码里给 Linux 留了口子——平台分叉模块、Python 运行时地址——但推理引擎的资产没有配,我也没有一台 Linux 测试机,mlx 那一半更不可能有。这里不承诺时间。

代码签名同样没有。Windows 安装包没签,SmartScreen 会拦一次,点「更多信息 → 仍要运行」。这是「没花钱买证书」的拦截,不是安全检测的结果——但你不该因为我这么说就放行:下载页附了 SHA-256,自己核对。

▍下载与上手

你的系统 下载哪个 要求
macOS 13+ LocalBrain_1.2.49_aarch64.dmg Apple Silicon,8 GB 统一内存起
Windows 10 1803+ / 11 LocalBrain_1.2.50_x64-setup.exe NVIDIA 显卡,驱动 527.41 以上;16 GB 内存起,MoE 专家放内存要 32 GB
Linux 暂无

模型发现页会先测试 ModelScope、HF-Mirror 与 Hugging Face,再按当前网络选择下载源;卡片能力标签用于说明已验证能力,不把模型名直接等同于能力

  • 装完打开,到「设置 → 本地运行环境」点「一键全装」:程序按显卡和驱动自动选 CUDA 版或 CPU 版推理引擎(CUDA 版约 640 MB),再装一个约 200 MB 的工具环境,两步都会写明在装什么、为什么;
  • 到「发现」下载一款 8 GB 档模型,Qwen3 8B 或 Gemma 4 E4B 都行,卡片上的「最低显存」按你的卡算;
  • 回「主页」启动模型,进「对话」——联网、读写本机文件、做文档,模型自己决定什么时候调用;
  • 没有 NVIDIA 显卡也能装,会走 CPU 版,慢很多,程序会在安装进度里说清。

建议 下载页:https://github.com/HackerChi-Hub/localbrain-releases/releases(Windows 版在 v1.2.50 预发布下)

摘要:8 GB 显存的 Windows 笔记本,本地文本模型加本地工具这条线已经能用了 两款 8 GB 档模型分别跑到 73.9 和约 60.8 token/s,窗口 32K 到 55K,联网、文件、文档三类工具在修完那三处之后都通了。多媒体那一半短期内不会来 Windows,Linux 没有时间表,自动更新要等私钥挪过来。我的判断只覆盖 8 GB 这一档——更大显卡上的窗口和卸载路径是同一套推导,但没有实机数据,用 12、16、24 GB 显卡的人试完请把结果发给我。

黑粉科技自制软件

产品 一句话 状态
黑粉剪辑 HyphenCut 对话式视频剪辑器,自带 MCP 可被 agent 驱动 正式迭代
黑粉盒子 HyphenBox 免费大模型 API 雷达 + 本地统一路由 初步构建 · 预览版
LocalBrain 把电脑变成私有 AI 盒子:转写/配音/生图/视频/MCP 一站管理 正式迭代
ScreenLex 光影词库 本地电影字幕变可复习英语词库,全程离线 正式迭代
分享到:

相关文章

返回首页