Mistral Large 4 公开预览:1 万亿参数、10 月底开放权重,本地能跑得动吗?

Mistral Large 4 公开预览:1 万亿参数、10 月底开放权重,本地能跑得动吗?

2026/10/0711 分钟
分类:技术分享
标签:#AI#新锐模型

Mistral Large 4 在 10 月 6 日上线了什么

Mistral Large 4 在 10 月 6 日开放了预览 API,官方计划于 2026 年 10 月底发布权重。今天可以尝试的是 Mistral Studio 上的远程调用,不是把模型下载到自己的电脑。月底开放权重也只是开始:许可证、推理软件和设备资源都要匹配,不能据此承诺普通 Mac 届时就能运行。

官方把它定义成 1 万亿参数、原生多模态的混合架构,激活参数约 490 亿。同一份公告里强调训练用了 3,800 块 NVIDIA Grace Blackwell GPU,训练与预览服务都跑在 Mistral 自有的欧洲数据中心。

1 万亿总参数与约 490 亿激活参数,最容易被误读成“只需要装下 490 亿参数”。可以想成一家有许多专科的小医院:一次看病只用到部分科室,但其他科室并没有因此消失。混合专家模型处理一次输入时只调用部分专家,能减少部分计算量;存储、内存和数据搬运的需求,不能只拿当次激活量估算。这个区别直接关系到本地部署,而不是一个可忽略的参数细节。

官方公告:总参数 1 万亿、激活参数 490 亿;权重计划月底发布。

官方自报的强项在哪些方向

Mistral 把 ML4 主推为「open-weight 模型里最强的一档」,重点强调网络安全、企业编码与多模态理解三块。下面这些数字都来自公告原文,属于官方报告成绩,不是独立验证。

网络安全:在开放权重里排前列

  • Artificial Analysis Cyber Index 排进全球前五,并在「非中国开放权重」一项里明显领先。
  • 在该指数一道「复现开源软件真实漏洞并修补」的题目上拿到 82%,是公告所列模型中最高分;同一题上 Claude Opus 5.5 与 GPT-6 Astra「接近零分」,原因是触发拒绝。
  • 在 Cybench(40 道安全竞赛题组成的基准)上解决率 93%。
  • 对间接提示注入的鲁棒性:在 Lakera 公开 B3 AI Security Benchmark 上抵抗 93.3% 的攻击,公告称未见到更高成绩。
  • JailbreakBench、StrongREJECT、AgentHarm 三套恶意请求测试的平均水平上,ML4 的拒绝率高于所列的开放权重对照模型。

为什么安全榜单要看测试方式?修漏洞通常要先在授权环境里证明问题确实存在,再检查补丁能否挡住它。官方把部分闭源模型的低分归因于拒答;这说明成绩混合了任务能力与安全策略的影响,不能直接推成“所有安全任务都更强”。Mistral 还称正在与审核过的合作伙伴做红队测试。使用者仍应限定授权范围,不把预览能力当成不受约束的攻击工具。

编码与代理工作流

  • DeepSWE v1.1:61.7%。

  • SWE-Atlas-QnA:59.4%。

  • Terminal-Bench 4:28.3%。

  • 三项合成的 Code Agent Index:49.8%,官方说法是领先 DeepSeek V4 Pro 0813 与 Qwen3.8 Max。

  • Surge AI 盲评(5 个模型):ML4 预览 3.74 分,第二名;对照是 Kimi K3 3.59、GLM-5.3 3.60、GLM-5.2 3.40,第一名 Claude Opus 5 4.22。

  • AutomationBench(657 条业务流,覆盖 Gmail、Google Sheets、Slack、Salesforce 等应用):59.9%。

  • AA-Briefcase(长链路知识工作 Elo 分):1,393。

多模态与视觉定位

官方编码评测原文;完整基准图请回来源查看,这不是独立复测。

官方称 ML4 能处理复杂文档、图表、自然图像,并把视觉能力和代理能力组合起来,从千兆像素卫星影像定位、到工程图纸的放大检查、再到 PDF 证据检索都被列为典型用法。在 Dense 200 这一视觉定位题上,ML4 报 42%,GPT-6 Astra 报 41%。

科学与数学

官方称 ML4 在 SciCode-Verified 上是开放权重中的最佳;并展示了一次性生成完整 Hartree–Fock 模拟的多步化学任务。数学方面,公告原文称 ML4 比 GLM-5.3 推理更精确、更结构化,并能长时间承担理论物理相关的应用数学任务。

知识工作与法务、金融

公告称通过第三方评测机构 vals.ai,ML4 在法务、金融两类代表任务上均高于 GPT-6 Astra,并在 HarveyAI 的 Legal Agent 基准上「超过所有开源模型」。FinWorkBench 测的是电子表格创建与编辑能力,官方公开了 Finance Agent v2 与 Finch(FinWorkBench)的结果。

人类偏好评测

公告原文:在编码、计算机辅助设计、数学与物理的人工对比中,ML4 在 CAD 与 STEM 上被偏好,编码与金融上「持平或接近 GLM-5.3」。这与上一节盲评里 ML4 编码排第二、Claude Opus 5 第一的结论方向一致。

训练规模与所谓「欧洲主权」

官方称模型由 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,预览服务也运行在自有欧洲数据中心。后训练结合代码执行、网络检索和多种检查办法,让模型在任务结果中接受反馈。可以把它理解成练习后看回执:文件有没有写对、代码有没有通过检查,比只判断回答听起来像不像正确更接近真实工作。训练规模说明研发投入,不是用户运行这个模型也需要相同数量的 GPU。

公告强调 ML4 会在多个全球区域可用,其中欧洲部署由 Mistral 全栈运营、独立于其他数字服务提供商、受欧洲法律管辖,并称训练语料覆盖 160 多种语言,包含欧盟全部官方语言。

把这条单独拆开看比较重要:所谓「主权部署」目前指的是欧洲区域那一档由 Mistral 自家运营的服务;权重月底放出后能否在用户自己的欧洲数据中心或本地机房跑,要等官方公布架构与许可证细则再说。公告没有给出本地部署所需的显存、内存与算力门槛,本地门槛目前无法核实。

API 价格与现阶段能做什么

10 月 7 日抓取的公告给出预览价格:每百万输入词元 1.36 美元,每百万输出词元 4.18 美元。词元是模型分割文字后计费的单位,并不与一个汉字或一个单词固定对应。若一次任务累计输入 100 万词元、输出 10 万词元,按这两项单价计算约 1.778 美元;这是假设算例,不是本次实付账单,也不包含其他服务费用。长任务应看累计用量,不能只看最后那一小段答案。

现阶段能做的事,按能力划分分别是:在 Mistral Studio 调用预览 API、做应用集成与评测;和经过审核的合作伙伴在「更宽松的安全策略」下做网络安全红队。本地自部署、企业内网部署以及权重开放后的二次分发,都要等月底放权重与许可证窗口之后再说。

这些成绩现在能证明什么、不能证明什么

  • 上面百分比与名次来自 Mistral 公告,其中部分引用第三方评测;本次没有逐一复核原始评测与复现条件,也没有完成独立横评。公开公告不等于代码、权重和测试记录已经全部开源。
  • 「开放权重里的最强」「比 DeepSeek V4 Pro 0813 与 Qwen3.8 Max 强」这类比较,只在 Mistral 自己挑选的基准和自己挑选的对手上成立;不同基准、不同提示词、不同推理参数下结论可能反转。
  • 「安全模型在网络安全题上超越 Claude Opus 5.5 与 GPT-6 Astra」是因为部分闭源模型拒绝执行这类任务,并不是 ML4 在所有任务上都领先;同样的逻辑下,编码题 Surge AI 盲评中 Claude Opus 5 仍然排第一。
  • 「主权部署」「欧洲法律管辖」目前覆盖的是 Mistral 自家运营的欧洲服务;权重开放之后的二次分发边界,要等官方许可证细则。
  • 「1 万亿参数、490 亿激活」不能只按激活参数估算内存。实际需要保存哪些权重、怎样调入专家、以何种精度运行,都要结合发布后的架构与软件方案;当前公告没有给出消费级设备实测门槛。
  • 「千兆像素卫星影像、工程图纸一次性读懂」属于官方 Demo 场景,公告没有公开具体的视觉分辨率、prompt 模板或人工复核成功率,本地实测前不要把演示当作稳定能力。

下一步该怎么看这次更新

对今天就要用的人来说,先去 Mistral Studio 申请预览 API 试用是最直接的路径,价格按 1.36 / 4.18 美元每百万 tokens 估算即可,不要把它当成长期承诺。

对手头只有一台 Mac 的人,现在不值得为了“月底开放权重”先买硬件。除了权重,运行时还会占用记住前文的缓存与处理图片的资源;总参数、精度、专家调度与读取速度都会影响体验。先等官方给出架构、许可证和可用运行方案,再拿自己的设备测试启动、回答与连续任务。现阶段能确认的是远程预览已推出,本地门槛仍未核实,不能承诺 64GB Mac 跑得动。

对关心网络安全工作流的人来说,重点关注的是 Mistral 与网络安全企业、欧洲政府机构在「更宽松安全策略」下做的红队结果,这部分是 ML4 最有差异化、也最容易引起争议的地方;选用前请评估所在司法辖区对「能复现并修补漏洞」类能力的合规边界。

建议 Mistral 在公告末尾说月底会放出权重、补齐架构细节、追加评测与后训练方法。本地可行性、许可证边界、是否真能取代现有栈,要在那一波材料出来之后才能下结论。

官方资料


🧰 我做的工具

这些工具都由我持续维护。预览版会明确标注,下载、更新和已知边界以发行页为准。

信息:黑粉盒子 HyphenBox 状态: 正式迭代

免费大模型 API 雷达:持续复测可用性,本地统一接口,Key 只存本机

下载与更新

信息:方寸智匣 LocalBrain 状态: 正式迭代

本地模型的多模态 MCP 工具箱:TTS / Whisper / 视频生成一站接入

下载与更新

信息:ScreenLex 光影词库 状态: 正式迭代

看美剧顺手把生词背了,Mac/Windows 双平台,免费

下载与更新

信息:黑粉录屏 HyphenScreen 状态: 正式迭代

录屏 + 智能剪辑一体:达芬奇式时间线、自动打码、导出前成片体检,免费

下载与更新


引用:黑粉科技 让AI成为你的超能力 本地部署 · 免费白嫖 · 自制软件 https://hyphentech.top

分享到:

留言

正在加载留言…

返回首页