Mistral Large 4 在 10 月 6 日上线了什么
Mistral Large 4 在 10 月 6 日开放了预览 API,官方计划于 2026 年 10 月底发布权重。今天可以尝试的是 Mistral Studio 上的远程调用,不是把模型下载到自己的电脑。月底开放权重也只是开始:许可证、推理软件和设备资源都要匹配,不能据此承诺普通 Mac 届时就能运行。
官方把它定义成 1 万亿参数、原生多模态的混合架构,激活参数约 490 亿。同一份公告里强调训练用了 3,800 块 NVIDIA Grace Blackwell GPU,训练与预览服务都跑在 Mistral 自有的欧洲数据中心。
1 万亿总参数与约 490 亿激活参数,最容易被误读成“只需要装下 490 亿参数”。可以想成一家有许多专科的小医院:一次看病只用到部分科室,但其他科室并没有因此消失。混合专家模型处理一次输入时只调用部分专家,能减少部分计算量;存储、内存和数据搬运的需求,不能只拿当次激活量估算。这个区别直接关系到本地部署,而不是一个可忽略的参数细节。

官方自报的强项在哪些方向
Mistral 把 ML4 主推为「open-weight 模型里最强的一档」,重点强调网络安全、企业编码与多模态理解三块。下面这些数字都来自公告原文,属于官方报告成绩,不是独立验证。
网络安全:在开放权重里排前列
- Artificial Analysis Cyber Index 排进全球前五,并在「非中国开放权重」一项里明显领先。
- 在该指数一道「复现开源软件真实漏洞并修补」的题目上拿到 82%,是公告所列模型中最高分;同一题上 Claude Opus 5.5 与 GPT-6 Astra「接近零分」,原因是触发拒绝。
- 在 Cybench(40 道安全竞赛题组成的基准)上解决率 93%。
- 对间接提示注入的鲁棒性:在 Lakera 公开 B3 AI Security Benchmark 上抵抗 93.3% 的攻击,公告称未见到更高成绩。
- JailbreakBench、StrongREJECT、AgentHarm 三套恶意请求测试的平均水平上,ML4 的拒绝率高于所列的开放权重对照模型。
为什么安全榜单要看测试方式?修漏洞通常要先在授权环境里证明问题确实存在,再检查补丁能否挡住它。官方把部分闭源模型的低分归因于拒答;这说明成绩混合了任务能力与安全策略的影响,不能直接推成“所有安全任务都更强”。Mistral 还称正在与审核过的合作伙伴做红队测试。使用者仍应限定授权范围,不把预览能力当成不受约束的攻击工具。
编码与代理工作流
-
DeepSWE v1.1:61.7%。
-
SWE-Atlas-QnA:59.4%。
-
Terminal-Bench 4:28.3%。
-
三项合成的 Code Agent Index:49.8%,官方说法是领先 DeepSeek V4 Pro 0813 与 Qwen3.8 Max。
-
Surge AI 盲评(5 个模型):ML4 预览 3.74 分,第二名;对照是 Kimi K3 3.59、GLM-5.3 3.60、GLM-5.2 3.40,第一名 Claude Opus 5 4.22。
-
AutomationBench(657 条业务流,覆盖 Gmail、Google Sheets、Slack、Salesforce 等应用):59.9%。
-
AA-Briefcase(长链路知识工作 Elo 分):1,393。
多模态与视觉定位

官方称 ML4 能处理复杂文档、图表、自然图像,并把视觉能力和代理能力组合起来,从千兆像素卫星影像定位、到工程图纸的放大检查、再到 PDF 证据检索都被列为典型用法。在 Dense 200 这一视觉定位题上,ML4 报 42%,GPT-6 Astra 报 41%。
科学与数学
官方称 ML4 在 SciCode-Verified 上是开放权重中的最佳;并展示了一次性生成完整 Hartree–Fock 模拟的多步化学任务。数学方面,公告原文称 ML4 比 GLM-5.3 推理更精确、更结构化,并能长时间承担理论物理相关的应用数学任务。
知识工作与法务、金融
公告称通过第三方评测机构 vals.ai,ML4 在法务、金融两类代表任务上均高于 GPT-6 Astra,并在 HarveyAI 的 Legal Agent 基准上「超过所有开源模型」。FinWorkBench 测的是电子表格创建与编辑能力,官方公开了 Finance Agent v2 与 Finch(FinWorkBench)的结果。
人类偏好评测
公告原文:在编码、计算机辅助设计、数学与物理的人工对比中,ML4 在 CAD 与 STEM 上被偏好,编码与金融上「持平或接近 GLM-5.3」。这与上一节盲评里 ML4 编码排第二、Claude Opus 5 第一的结论方向一致。
训练规模与所谓「欧洲主权」
官方称模型由 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,预览服务也运行在自有欧洲数据中心。后训练结合代码执行、网络检索和多种检查办法,让模型在任务结果中接受反馈。可以把它理解成练习后看回执:文件有没有写对、代码有没有通过检查,比只判断回答听起来像不像正确更接近真实工作。训练规模说明研发投入,不是用户运行这个模型也需要相同数量的 GPU。
公告强调 ML4 会在多个全球区域可用,其中欧洲部署由 Mistral 全栈运营、独立于其他数字服务提供商、受欧洲法律管辖,并称训练语料覆盖 160 多种语言,包含欧盟全部官方语言。
把这条单独拆开看比较重要:所谓「主权部署」目前指的是欧洲区域那一档由 Mistral 自家运营的服务;权重月底放出后能否在用户自己的欧洲数据中心或本地机房跑,要等官方公布架构与许可证细则再说。公告没有给出本地部署所需的显存、内存与算力门槛,本地门槛目前无法核实。
API 价格与现阶段能做什么
10 月 7 日抓取的公告给出预览价格:每百万输入词元 1.36 美元,每百万输出词元 4.18 美元。词元是模型分割文字后计费的单位,并不与一个汉字或一个单词固定对应。若一次任务累计输入 100 万词元、输出 10 万词元,按这两项单价计算约 1.778 美元;这是假设算例,不是本次实付账单,也不包含其他服务费用。长任务应看累计用量,不能只看最后那一小段答案。
现阶段能做的事,按能力划分分别是:在 Mistral Studio 调用预览 API、做应用集成与评测;和经过审核的合作伙伴在「更宽松的安全策略」下做网络安全红队。本地自部署、企业内网部署以及权重开放后的二次分发,都要等月底放权重与许可证窗口之后再说。
这些成绩现在能证明什么、不能证明什么
- 上面百分比与名次来自 Mistral 公告,其中部分引用第三方评测;本次没有逐一复核原始评测与复现条件,也没有完成独立横评。公开公告不等于代码、权重和测试记录已经全部开源。
- 「开放权重里的最强」「比 DeepSeek V4 Pro 0813 与 Qwen3.8 Max 强」这类比较,只在 Mistral 自己挑选的基准和自己挑选的对手上成立;不同基准、不同提示词、不同推理参数下结论可能反转。
- 「安全模型在网络安全题上超越 Claude Opus 5.5 与 GPT-6 Astra」是因为部分闭源模型拒绝执行这类任务,并不是 ML4 在所有任务上都领先;同样的逻辑下,编码题 Surge AI 盲评中 Claude Opus 5 仍然排第一。
- 「主权部署」「欧洲法律管辖」目前覆盖的是 Mistral 自家运营的欧洲服务;权重开放之后的二次分发边界,要等官方许可证细则。
- 「1 万亿参数、490 亿激活」不能只按激活参数估算内存。实际需要保存哪些权重、怎样调入专家、以何种精度运行,都要结合发布后的架构与软件方案;当前公告没有给出消费级设备实测门槛。
- 「千兆像素卫星影像、工程图纸一次性读懂」属于官方 Demo 场景,公告没有公开具体的视觉分辨率、prompt 模板或人工复核成功率,本地实测前不要把演示当作稳定能力。
下一步该怎么看这次更新
对今天就要用的人来说,先去 Mistral Studio 申请预览 API 试用是最直接的路径,价格按 1.36 / 4.18 美元每百万 tokens 估算即可,不要把它当成长期承诺。
对手头只有一台 Mac 的人,现在不值得为了“月底开放权重”先买硬件。除了权重,运行时还会占用记住前文的缓存与处理图片的资源;总参数、精度、专家调度与读取速度都会影响体验。先等官方给出架构、许可证和可用运行方案,再拿自己的设备测试启动、回答与连续任务。现阶段能确认的是远程预览已推出,本地门槛仍未核实,不能承诺 64GB Mac 跑得动。
对关心网络安全工作流的人来说,重点关注的是 Mistral 与网络安全企业、欧洲政府机构在「更宽松安全策略」下做的红队结果,这部分是 ML4 最有差异化、也最容易引起争议的地方;选用前请评估所在司法辖区对「能复现并修补漏洞」类能力的合规边界。
建议 Mistral 在公告末尾说月底会放出权重、补齐架构细节、追加评测与后训练方法。本地可行性、许可证边界、是否真能取代现有栈,要在那一波材料出来之后才能下结论。
官方资料
🧰 我做的工具
这些工具都由我持续维护。预览版会明确标注,下载、更新和已知边界以发行页为准。
信息:黑粉盒子 HyphenBox 状态: 正式迭代
免费大模型 API 雷达:持续复测可用性,本地统一接口,Key 只存本机
信息:方寸智匣 LocalBrain 状态: 正式迭代
本地模型的多模态 MCP 工具箱:TTS / Whisper / 视频生成一站接入
信息:ScreenLex 光影词库 状态: 正式迭代
看美剧顺手把生词背了,Mac/Windows 双平台,免费
信息:黑粉录屏 HyphenScreen 状态: 正式迭代
录屏 + 智能剪辑一体:达芬奇式时间线、自动打码、导出前成片体检,免费
引用:黑粉科技 让AI成为你的超能力 本地部署 · 免费白嫖 · 自制软件 https://hyphentech.top
熬夜烧钱三千字扫码随心一杯茶
微信扫码长按保存图片,用微信「扫一扫」从相册选取


留言
正在加载留言…