本地 AI · 全维度实测
M5 Pro 跑完 5 个维度本地 AI 到底能做什么
LLM · TTS · 图像 · 视频 · 视觉理解全部真实数据 · 提示词可复现 · 无修饰
2026年5月 · M5 Pro 64GB · 无API · 纯本地
今年 5 月,我在 MacBook Pro M5 Pro 64GB 上做了一次完整的本地 AI 评测。不联网,不调 API,全程本地推理——测了大语言模型、语音合成、图像生成、视频生成、视觉理解,五个维度,每个测试都包含完整提示词、参数、输出结果和效果评价。
一、LLM 文字能力:4 个模型同台竞技
测了 Qwen3.6 和 Gemma4 各两个版本,每个模型做 10 道通用能力题 + 8 道安全越狱测试。
| 模型 | 参数 | 架构 | 速度 | 内存 | 安全 |
|---|---|---|---|---|---|
| Gemma4-E4B | 4B | Dense | 74.5 tok/s | 4.3 GB | 87.5% ✅ |
| Gemma4-31B-U | 31B | Dense | 13.1 tok/s | 11.5 GB | 25% ❌ |
| Qwen3.6-27B | 27B | Dense | 16.0 tok/s | 14.4 GB | 87.5% ✅ |
| Qwen3.6-35B-MoE | 35B(激活3B) | MoE | 79.7 tok/s ⚡ | 7.6 GB | 25% ❌ |
二、TTS 语音合成:mlx-audio Metal 加速 + UP主声音克隆
使用 mlx-audio(Metal 原生加速)驱动 Qwen3-TTS,同时使用 Qwen3-TTS-12Hz-Base 进行 UP主声音克隆,实现零样本声音迁移。
RTF 是什么?
RTF(Real-Time Factor,实时率)= 生成时间 ÷ 音频时长
RTF = 1.83 → 生成 1 秒音频需要等 1.83 秒(比实时慢 1.83 倍)RTF = 30 → 生成 1 秒音频需要等 30 秒(比实时慢 30 倍)RTF < 1 → 真正实时,比说话速度还快
通俗理解:你说一句 10 秒的话,RTF=1.83 的 TTS 需要 18.3 秒生成;RTF=30 的需要等 5 分钟。
实测结果(VoiceDesign · Metal GPU)
RTF = 1.83 · 生成 11.4s 音频耗时 6.25s · 峰值内存 9.06GB
新增:UP主声音克隆 · Metal GPU · Qwen3-TTS-12Hz-Base
RTF = 0.49 · 比实时还快 · 6 段口播稿全部生成完成
技术实现细节(2026-05-17 更新)
参考音频预处理命令:
ffmpeg -i 参考音频.wav -t 5 -ar 24000 -ac 1 ref_5s.wavPython API 调用示例:
from qwen_tts import Qwen3TTSModel
model = Qwen3TTSModel.from_pretrained(MODEL_PATH, device_map="cpu")
wavs, sr = model.generate_voice_clone(
text="要生成的文本",
ref_audio="ref_5s.wav",
ref_text="前5秒对应的文本内容"
)三、图像生成:FLUX.1-dev 全流程实测
名词解释 — 看这里先
FLUX.1-dev:目前最强的开源文生图模型之一(Black Forest Labs 出品),12B 参数,支持高精度写实和创意风格。本地运行需要 CPU offload(MPS 不支持全量 float16),因此速度较慢。
LoRA:Low-Rank Adaptation,一种微调技术。在基础模型上附加一个小型适配层,注入特定人物/风格的特征,无需重新训练整个大模型。触发词(Trigger Word)= 在 Prompt 中写上特定词(如 HYTChi),激活 LoRA 的效果。
生成参数:Steps(去噪步数,越多越精细但越慢)、CFG Scale(提示词服从度,越高越贴近 Prompt 但可能过于饱和)、Seed(随机种子,固定后结果可复现)。
冷启动 vs 热缓存:首次生成时模型权重从磁盘加载到 Metal GPU 内存,耗时最长。后续生成权重已驻留缓存,速度提升约 3×。
测试设计:5 个不同场景考察 FLUX 的风格泛化能力(自然风景、赛博朋克城市、人物写真、抽象艺术、产品摄影),全部使用相同生成参数。
📸 FLUX.1-dev 普通文生图(5 张,无 LoRA)
场景 1:自然风景
场景 2:赛博朋克城市夜景
场景 3:专业商务人像
场景 4:抽象液态金属
场景 5:AI 机器人产品图
🪪 FLUX + HYTChi LoRA v3:个人身份克隆
LoRA 身份克隆的工作原理
训练阶段:用本人多角度照片微调 FLUX,让模型记住特定人物的面部特征,并绑定到触发词 HYTChi。
使用阶段:在任何 Prompt 中加入触发词,模型会将该人物的面部特征「注入」到生成结果中,并与 Prompt 中的场景/姿态/服装描述融合。
本次使用:HYTChi_flux_lora_v3.safetensors | LoRA Scale=1.0 | 其余参数与普通生成相同
身份克隆 1:商务头像
身份克隆 2:休闲户外
身份克隆 3:科技演讲者
四、视频生成:LTX-2.3 MLX 全流程实测
名词解释 — 看这里先
T2V(Text-to-Video 文生视频):只给文字描述,让模型凭空生成视频。纯粹考验模型对文字的理解和视频生成能力。
I2V(Image-to-Video 图生视频):给一张图片 + 文字描述,让模型以这张图为第一帧,生成后续的动态视频。理论上能保留图片中的人物/场景,驱动他/它运动。
Distilled 蒸馏模式:经过蒸馏压缩的快速生成模式,步数少,速度快(1~2 分钟),质量略低。
Two-Stage 两阶段模式:先生成低分辨率草稿,再精细化放大,步数多,速度慢(8~12 分钟),质量更高。
测试设计:4 个场景 × 2 种生成模式 = 8 条视频,覆盖 T2V 和 I2V 两种任务类型。所有提示词均为英文(LTX 官方推荐语言)。
📹 T2V 文生视频:完全由 Prompt 驱动
以下两个场景不提供任何输入图,模型完全依靠文字描述凭空生成视频内容。
场景一:城市夜间街道
场景一:城市夜间街道
场景二:科技实验室
场景二:科技实验室
🖼️ → 📹 I2V 图生视频:以图片为起始帧驱动运动
以下两个场景需要提供一张输入图片作为第一帧,Prompt 描述希望图中主体做出的动作。测试使用的输入图是 picsum 随机图库中的一张巴哥犬(哈巴狗)照片,这是测试数据选取的失误——原本应该是人物照片。但恰好验证了一个关键问题:LTX I2V 能否保持输入对象的身份、并按 Prompt 驱动运动?
场景三:图中主体「说话」
📊 综合评价
| 维度 | 蒸馏模式 | 两阶段模式 |
|---|---|---|
| 生成速度 | 68~109s(快) | 180~738s(慢) |
| Prompt 跟随度 | 偏差大(⚠️ 两条明显偏) | 明显优于蒸馏版 |
| I2V 身份保持 | 5帧后人脸漂移 | 同样漂移,无法克隆真人 |
| 适合场景 | 快速原型验证 | 对质量有要求的场景 |
五、视觉理解:Qwen2-VL-7B 七项测试
✅ 优秀:OCR + 图表 + 代码识别
⚠️ 有趣意外:人物分析测试图实为哈巴狗
❌ 弱项:细节幻觉 + 多图混淆
六、总结
| 能力 | 可用性 | 说明 |
|---|---|---|
| 实时 LLM 对话 | ✅ 完全可用 | MoE 79 tok/s,流畅 |
| 视觉理解(单图) | ✅ 完全可用 | OCR/图表/代码 |
| 本地 TTS 配音(Metal GPU) | ✅ 完全可用 | mlx-audio RTF=0.49,UP主声音克隆 |
| 图像生成(偶发) | ⚠️ 受限可用 | 热缓存后 6 分钟/张 |
| 视频原型(蒸馏) | ⚠️ 受限可用 | 1~2 分钟,内容有偏差 |
| 视频人脸一致性 | ❌ 不可用 | 需 H100 级算力 |
| 批量图像生产 | ❌ 不可用 | 冷启动 17 分钟/张 |
最出人意料的发现
4B 的 Gemma4-E4B,在速度和安全性上同时打败了 27B 和 31B 的大模型
在 Apple Silicon 上,小而快的模型有时比大而全更有价值。参数量只是一个维度——架构、对齐训练、量化方式,每一个都在影响最终表现。
所有测试在 M5 Pro 64GB 本地完成,无 API 调用。提示词、参数均已如实标注,结果可复现。数据时间:2026 年 5 月。
