一个把 Mac 变成私有 AI 盒子的桌面应用,赌的不是“替代云端大脑”,而是云端大脑永远给不了的那半张地图。
黑粉科技 · 自制软件 · 2026-08-02 · 全文约 2600 字,阅读 7 分钟
一台开了飞行模式的 M5 Pro,断网,64 GB 统一内存,磁盘还剩 493 GB。就在这台完全离线的机器上,Claude Code 把一段三小时的会议录音转成了逐字稿,中途没碰过一次网络,也没花一分钱 API 费用。
干这件事的,是我做的一个桌面应用,叫 LocalBrain。它现在的版本号是 0.3.35。

很多人第一反应是:本地模型又打不过 GPT,跑个量化的 7B、30B,聪明程度差一截,图什么?这个问题问得对。而 LocalBrain 的答案,恰恰是先认下这半句——本地弱模型当编码大脑,体验确实一般。真正值钱的东西,在别处。
一、Ollama 只解决了一半的问题
先说清楚它站在哪。把本地大模型跑起来这件事,Ollama 已经做得足够好——一行 ollama run,模型就转起来了。这是本地 AI 的 Docker 时刻:chroot、cgroups、namespace 这些内核能力在 Docker 之前早就存在,Docker 的价值从来不是发明,而是把它们封装成谁都会用的一条命令。Ollama 对本地 LLM 做的是同一件事。
问题在于,一个真正的 agent——Claude Code、Codex 这种能自己调工具干活的——光有一颗会说话的文本脑不够。它需要把录音转成文字,需要合成配音,需要生成封面图、B-roll 视频,需要联网读网页。这些是多模态的体力活,而任何一个云端 LLM 运行器,都没法把“在你本机上转写、配音、生图”这样的能力,作为工具交到 agent 手里。
这就是那半张没人补的地图。LocalBrain 把本地多媒体后端全部包装成 MCP 工具——转写、配音、文生图、视频,再加上三个联网工具,一共七个。任何支持 MCP 的 agent,一键写入配置就能调。
上手提示:这些工具跟“你用什么大脑”完全解耦。让云端的 Claude 负责思考编排,让本地的 LocalBrain 负责转写、配音、生图这些不该花 token、也不该上传的活。「一键写入 MCP」只往对应 agent 的配置里增改 localbrain-* 这几条,不动你原有设置。

二、把两件事分清楚,比多加一个功能更难
集成页只讲两件事,这个“只”字是刻意的。第一件,本地 MCP 工具:把那七个工具交给任意 agent,包括 Claude、GPT 这类在线强脑。第二件,本地模型当脑:让 OpenCode、ScreenLex 直接用本地模型推理,全本地、免 API key。
关键在第二件里被砍掉的部分。早期版本给 Codex、Claude Code 也做过“本地模型当脑”的接入卡,后来删了。原因写在产品里,很直白:本地弱模型给这类重编码工具当大脑,价值低;Codex 那条链路还有上游兼容性的坑。与其硬撑一个体验差的功能,不如让它们保留云端强脑,只通过 MCP 调本地工具。
这是个反直觉的选择。市面上吹“完全本地替代 ChatGPT”的项目一大堆,几乎没人愿意承认“我这套当编码脑不好用”。LocalBrain 反过来,把能力边界明明白白写进 UI。诚实的边界,比夸大的全能承诺难做得多,也可信得多。
一个更硬的问题:如果本地模型注定当不好编码大脑,那 LocalBrain 到底在卖什么?答案是控制权——本地、离线、免费、数据不出机器。这跟当年 MariaDB 从 MySQL 分叉是同一个母题:用户想重新握住自己的算力和数据主权。
三、掀开引擎盖:五个后端,各管一摊
真正决定一个本地 AI 工具好不好用的,是引擎盖下面的工程。LocalBrain 把五类本地后端并排管起来,每个占一个端口,中间有一个内存仲裁器,防止你一口气加载超过统一内存预算的模型,把整机拖垮。
后端 | 引擎 | 端口 | 干什么 |
大模型 / 视觉 | mlx_lm.server | 11434 | 对话、编码、OCR |
语音转写 | whisper_server(MLX) | 11435 | 录音转文字 |
语音合成 | tts_server(mlx-audio) | 11436 | 配音、声音克隆 |
图像 | image_server(Z-Image) | 11437 | 文生图 |
视频 | video_server(LTX) | 11438 | 本地视频生成 |
内存仲裁不是句空话。主页上每个模型都标了预估占用——Qwen3.6-27B 是 27.5 GB 权重、跑起来预估吃 31.8 GB;Gemma4-31B 是 18.5 GB、预估 21.8 GB。在 64 GB 的 M5 Pro 上,你能清楚看到“再开一个会不会爆”,而不是等它把整机卡死才发现。
这张表背后还有个容易被忽略的设计:自包含运行时。LocalBrain 自带一份 Python 和隔离的虚拟环境,首次运行把内置的五个 stdio 服务装进去。换句话说,一台全新的、没装过任何开发环境的 Mac,下载即用,不碰你的系统 Python。
改别人的配置文件是件让人心里发毛的事。集成页右上角那个「一键恢复接入」就是为这个准备的:每次写入前先备份,一键就能还原成动手之前的样子。给工具留一条随时反悔的退路,比功能本身更能让人敢按下第一个按钮。
模型这块,它不做“应用商店”式的海量堆砌,而是精选。每个下载条目都标了体积和最低内存要求,一眼就知道自己这台机器扛不扛得住。
模型 | 用途 | 体积 | 最低内存 |
Whisper Large v3 Turbo | 转写 | 1.6 GB | — |
Qwen3-TTS 12Hz 1.7B | 配音 / 克隆 | 4.0 GB | — |
Qwen3-VL 30B 8bit | 视觉 / OCR | 31 GB | — |
Z-Image Turbo | 文生图 | 33 GB | — |
LTX 2.3 Distilled MLX | 视频生成 | 46 GB | — |
Qwen3.6 35B-A3B(MoE)4-bit | agent 首选脑 | 约 19 GB | 32 GB |

下载源这个细节,是给国内用户的。HuggingFace 官方在国内经常龟速,LocalBrain 内置了魔搭和 HF-Mirror 两个国内镜像,还能「测速并选最快」,自动挑一条通的路。这类“最后一公里”的体验,往往比多支持一个模型更影响你日常是否愿意打开它。
那颗被标成「agent 推荐」的模型是 Qwen3.6 35B-A3B——一个 MoE 结构,35B 总参数里每次只激活约 3B,又快又省内存,是本地当编码脑时相对能打的一个。注意措辞是“相对能打”,不是“吊打云端”。
四、真正省下的,是那个“要不要付费”的念头
把镜头拉到普通用户的钱包和工作流上,本地 AI 的意义才落地。云端 API 的隐性成本,不只是账单,还有决策成本。每一次调用背后都有个小小的犹豫:这次值不值得花这个 token?做配音要重录十遍、做封面要生成几十张的时候,这个念头会累积成真实的摩擦。本地推理的边际成本趋近于零之后,这个念头直接从工作流里消失了——试错第一次变得无痛。
隐私是另一半。会议录音、身份证 OCR、私人视频素材,上传到云端 API,就意味着它可能被缓存、被日志留存。LocalBrain 的对话页角落写着一行小字:会话仅保存在这台电脑,不会上传。断网也能用,是这句话的硬件担保。

举个具体的活。做一条短视频,本地一条龙是这样跑的:Whisper 把口播录音转成字幕,Qwen3-TTS 用克隆的声音生成配音,Z-Image 出一张封面,LTX 补几段空镜 B-roll——四步全在这台断网的 Mac 上,云端的 Claude 只负责把它们串起来编排。整条链路一次云端调用都没有,也就一分钱都不花。这正是“云端强脑 + 本地手脚”最直白的样子。
这里值得插一句 Dropbox 的旧事。2007 年 Dropbox 刚发布时,有人在 Hacker News 上评论:这东西你用 rsync 加 FTP 自己就能搭,何必用它。后来的故事大家都知道了。能自己拼,和会有人愿意自己拼,是两回事——把一堆命令行工具、Python 环境、模型权重、端口管理封装成“下载即用”,这件封装本身就是产品。LocalBrain 对 MLX 生态做的,就是这件事。
维度 | 云端 API | Ollama | LocalBrain |
本地文本推理 | ✗ | ✓ | ✓ |
多模态工具(转写/配音/生图/视频) | 部分且付费 | ✗ | ✓ 作 MCP 工具 |
联网工具给 agent 用 | 少见 | ✗ | ✓ 免 key |
数据不出本机 | ✗ | ✓ | ✓ |
边际调用成本 | 按量计费 | 趋近 0 | 趋近 0 |
一键接入云脑 agent | — | — | ✓ |
这张表里,LocalBrain 唯一不占优的,是那一格没写出来的:本地文本脑的绝对智力。这一点它不藏着,前面已经认过了。
五、它现在是什么,不是什么
说点不给自己贴金的现状。LocalBrain 走到 0.3.35,带自动更新——它会去公开发布仓拉最新版本,用签名校验,静默升级。这是一个认真在迭代的私人工具,不是一个成熟的商业产品。它有明确的适用人群:用 Apple Silicon Mac、在意隐私、想给 agent 配一套本地手脚、并且能接受本地文本脑没那么聪明的人。
如果你正好是这类人,它能实实在在省下你的 API 账单和上传隐私的担忧;如果你要的是最强的编码大脑,它老实建议你——大脑继续用云端的,把本地这套当手脚就好。
一句实在话:本地大模型现阶段确实打不过顶级云端模型,这不是 LocalBrain 能改变的。它能改变的,是让你在“打不过的那颗脑”之外,多一套云端给不了、还免费的本地能力。
一句话总结:LocalBrain 没有假装本地能替代云端。它做的是一件更朴素、也更难被反驳的事——把 Apple Silicon 上那些零散、难装的本地 AI 能力,封装成任何 agent 都能一键调用的工具,让隐私和试错成本这两笔账,重新回到你自己手里。
📥 下载与更新:github.com/HackerChi-Hub/localbrain-releases/releases
🌐 项目主页:hyphentech.top/localbrain
相关可用资源:Ollama(ollama.com)· MLX(github.com/ml-explore/mlx)· Model Context Protocol(modelcontextprotocol.io)
分享到:
