摘要 30期不是30堂课。从一个会说话的程序、两次AI寒冬,到你电脑上真正能用的模型:沿着一条故事线,把知识、真实产物与选择连起来。 黑粉科技 · 2026-10-05
9月那次测试,我让一台64GB Mac带着本地模型连做5道网页题。最后,1题正式交付,另3题可运行但没有交付,还有1题没写完、无法运行。黑洞、城市、水墨长卷都出来了,验收表却没有跟着一起漂亮起来。能写、能跑、能把事情做完,是三个不同的门槛。
原来我想看模型能不能写代码,后来却不断排查:到底是模型、工具参数、运行引擎,还是我自己的代理程序出了问题?这些经历来自9月留存的记录,不是今天重跑。它们让我想把散落在评测、教程和工具开发里的知识连起来,做成《你真的懂AI吗?》。
这个系列计划30期,沿着知识库原有的全景、起源、原理、名场面、实操和边界顺序展开;只把相邻且适合一起讲的资料合并。无论你在用ChatGPT还是本地模型,目标都不是多背30组术语,而是遇到答案不可靠、费用算不清、模型跑不动或任务做不完时,知道先检查哪一环。第一期既给你整套阅读路线,也拿一次回答示范:知识怎样变成判断和行动。

这30期,帮你从“会提问”走到“会判断”
如果你也碰过这些情况——回答很像真的却找不到出处,跑分很高却办不成事,模型能装进电脑却越聊越慢——这套系列就是为这些具体问题准备的。无需先学完编程,也不要求换电脑;练习可以从一封邮件、一段回答或一个小任务开始。
- 第01—03期,先看全景,再沿着两次寒冬与开放权重的赛跑走进AI的起源。
- 第04—16期,依次拆开网络、词元、向量、注意力、训练、推理和一次对话,再看模型版图、评测、文件与硬件。
- 第17—21期,用真实名场面回看这些机制;第22—27期进入本机运行、量化、知识库与工具,第28—30期讨论幻觉、规模和选择的边界。
前10期逐篇计划和练习放在后面的表格里。这一篇先让你知道:系列适合谁、黑粉科技以前做过什么,以及看懂一次回答能怎样改变你今天的用法。
黑粉科技做什么?把AI从发布会搬到你的桌面
如果你第一次来,这里是黑粉科技。我有台Mac,也折腾普通电脑和自己写的软件。宗旨是“让AI成为你的超能力”,主要做三件事:本地跑、免费用、自己造。 重要模型发布也会跟进,但要继续追问:它解决哪件事,普通设备要付出什么,免费到哪一步,你怎样拿回一个能用的结果?
| 内容主线 | 我会讲什么 | 你应该获得什么 |
|---|---|---|
| 本地部署 | 模型安装、内存与速度、工具调用、长任务和失败复盘 | 知道自己设备适合什么,不把能启动误当能长期用 |
| 免费资源 | 免费API、开源平替、软件与素材入口,写清额度、许可和付费墙 | 有可核实的获取与使用路径,不把一次赠金当永久免费 |
| 自制软件 | 把重复操作做成工具,展示真实功能、修错过程与发行边界 | 不只看产品名,能判断它是否解决自己的问题 |
| 重要模型与原理 | 核对模型开放范围、能力、格式和硬件门槛,用热点解释机制 | 面对新名词会问条件、证据和成本,不必每次都追最大的模型 |
完整实测与长视频以B站为主,YouTube同步视频;公众号承载长文、复盘与精选提醒,官网集中保存完整文章、工具和资源入口。形式不同,标准一样:介绍和实测分清,成功和失败都看,结果要能回到记录。

不从零许愿:已经有哪些内容和工具?
截至2026年10月5日,官网已有63篇已发表中文原文;译文、草稿和这套尚在制作的系列没有重复计入。它们覆盖模型实测、部署教程、资源复核与工具介绍。这是内容数量,不是63次独立实验;下面给出能直接打开的内容入口。

归档里的两篇分别问“Mac、Windows、Linux怎么选”和“免费API到底还有几个能用”。前者把电脑选择拆成内存、兼容与维护,后者把免费拆成真实请求、额度和失败边界。一个决定任务放在哪台机器上,一个决定哪些任务值得交给在线服务。这个系列会把背后的知识接起来,读完以后,你可以回到旧评测里重新判断条件,而不只记住当时的结论。
目前还有4款公开自制软件,把这些问题接成可以使用的功能:黑粉盒子管理免费模型API候选与本地路由;方寸智匣LocalBrain管理本地模型与多模态工具;ScreenLex把本地影视字幕整理成英语学习词库;黑粉录屏把录制、剪辑和导出检查串起来。它们不是学习本系列的必装清单,而是部分案例的工具入口;具体平台、版本与下载见文末。
如果你今天就想拿点有用的东西,可以从下面8个内容入口开始。它们是已发表内容的精选路径,不是另外8款自制产品。
| 你想解决什么 | 已有内容入口 | 拿来怎么用 |
|---|---|---|
| 不知道怎样把需求说清楚 | 12个日常场景模板 | 挑场景替换自己的任务条件,别照抄夸张效率承诺 |
| 找可用的免费模型接口 | 免费AI API复测记录 | 先看测试日期、额度和限制,再做自己的最小请求 |
| 想用普通电脑跑模型 | 11个低内存模型的旧实测 | 对照设备和8K上下文条件,不把结论外推到任意长对话 |
| 想比较本地AI能力 | 6个本地AI的测试记录 | 查看不同任务和失败点,不只看一张速度表 |
| 想让模型做完一件事 | 5道网页游戏任务与复现材料 | 按同一验收条件看交付、能跑和放弃的区别 |
| 想比较写报告的能力 | 5个模型做同一份电影报告 | 比较事实、分析和交付,而不是只比回答长短 |
| 想做一集AI动画 | 动画流程与成本分析 | 顺着角色、镜头、声音、剪辑的环节核算投入 |
| 想找设计与开发资源 | 免费资源站目录 | 按用途找入口,许可证与当前免费政策仍需复核 |
你可以先选一条最贴近自己的路径:正在挑电脑,先看部署与内存;每天写邮件、报告,先看任务模板和事实核实;想让模型直接动手,先看五道题与交付检查。模板库覆盖12个日常场景;接口清单、速度与资源额度则有日期,过期了要重查,不把旧记录包装成今天的新政策。
这些旧内容不是要你一次读完,而是给下面的知识找落脚点:免费接口怎么查证,电脑怎样选,模型怎样交付。现在就拿其中那组五道题打开这一篇,先看结果,再拆开它背后的零件。
先看一组真实作品:漂亮的作品,为什么还不算做完?
拿五道题做开篇的例子,因为它同时暴露了模型能力和系统边界。题面要求只交付一个HTML文件,不借第三方库、不加载网络资源,断网双击也能打开;考的是三维引力模拟、时间循环、城市寻路、中文互动长卷与神经网络可视化。以下挑出能说明不同问题的结果,完整轮次和复现材料见五道题测试。

《奇点实验室》是唯一正式交付的一题:22轮、6902秒,约115分钟,最后文件45018字节。模型自己提交的第三组36步交互检查全过;另一个独立脚本按19项检查通过18项,页面没有运行时错误。这不是“19项全满分”,两套检查测的东西不同,不能把一次交付改写成从此不会犯错。

这张图的吸引力在于:文字要求真的变成了可以运行的程序。可若只把截图发出来,说“本地AI一次搞定物理模拟”,就把中间22轮和失败处理都擦掉了。读者看见的是几秒钟,我付出的却是一个多小时和一条完整执行链。作品可以好看,证据不能只剩好看的那一张。
《霓虹城》显示的是另一道门槛:道路、车辆、小地图和任务都出现了,白天与夜间的状态也不同,可两小时预算到点前没有正式交付,“按W加速”的检查仍没过。两张图能让你看见状态变化,却不能替驾驶操作验收。这是第14、24、26期要继续讲的问题:测试覆盖了什么,完成又由谁判定?


《星槎异闻录》说明约束怎样被遗漏。五个场景、水墨视差、古文与今译都出现了,页面最后能运行,可原创仿古文只写了228字,题目要求至少350字。这不是古籍,也不是没有做,而是做得不完整。漂亮页面与不合格字数可以同时存在,审美满意不能替要求签字。

《神经元熔炉》把第4期的神经网络变成了可以观察的画面:样本、连接、决策边界、损失和准确率一起更新。旧核验中它有5个画布、22个控件,无运行时错误,但到时未主动交付。截图里的87.5%属于这个演示的分类任务,不是生成它的语言模型得分;这种“分数到底在给谁打分”的误会,会接到第14期。

再看那道没有跑起来的题:《六十秒后重启》。旧记录里最后文件写到99268字节,仍然没闭合。代码字数很多、过程很忙,结果却不能交付。这个失败没有被我从结果表里删掉,因为它正好提醒我们:AI输出的多少,与它实际完成的多少,不是同一个指标。
| 你看到的证据 | 能够支持的判断 | 暂时不能支持的判断 |
|---|---|---|
| 有一段代码 | 模型生成了程序文本 | 文件已落盘、语法正确、可以运行 |
| 浏览器页面打开 | 该版本有运行画面 | 全部操作、性能和边界都正确 |
| 一次自检通过 | 这组检查在这一版通过 | 题目所有要求都被覆盖 |
| 按原题验收后交付 | 在这次条件下完成该任务 | 换题、换模型或下一版也必定完成 |
同一组作品里,代码生成、状态变化、条件遗漏和完整交付同时存在。第一期先把它们放在一起区分这些门槛,后面再逐期解释原因。先回到标题里的问题:“猜下一个词”怎么能组合出程序?答案要从模型怎样生成、软件怎样执行两边拆开,不能只给它换一个“高级输入法”或“全知助理”的外号。
先看全景:别把14个零件的责任都算给模型
先看大象的全身照,再研究鼻子。这个办法比一上来背缩写管用:你先知道每个名词住在哪里、管什么、出了问题该检查谁。对象地图告诉你系统有哪些零件,系列计划告诉你接下来往哪走;两张地图都不是排行榜。

下面这张表最值得看的是第三列。回答胡编,未必是检索坏了;模型没找到文件,未必是智力不够;电脑内存够,也不代表工具链就能完成任务。把不同零件的责任分开,才不会一次失败就开始下载另一个更大的模型。图中的检索、工具和量化是可选环节,不是每次聊天都会全部经过。
| 零件与常见名词 | 主要管什么 | 它不保证什么 |
|---|---|---|
| ①分词与嵌入:词元、向量 | 把输入变成编号与模型使用的表示 | 切分完成不代表事实核实;向量相似不等于正确 |
| ②模型骨架:注意力、专家网络 | 决定模型计算的结构与信息交互方式 | 仅凭架构名不能判定成品能力 |
| ③训练:预训练、微调、偏好优化 | 用数据和目标更新参数 | 普通聊天不会自动把新知识写入固定权重 |
| ④权重:模型参数、检查点 | 保存训练得到的参数 | 有权重不等于具备联网、文件权限或可用服务 |
| ⑤量化:低比特权重 | 减少部分权重的存储与运行开销 | 不是无损压缩;质量与工具调用表现可能改变 |
| ⑥推理引擎:llama.cpp、MLX | 加载模型,执行计算并输出结果 | 格式能识别不等于架构能运行;实现与模板会影响结果 |
| ⑦上下文与KV缓存 | 利用本轮输入和历史;复用已有键值计算 | 长窗口不保证不遗漏;缓存不等于跨会话记忆 |
| ⑧采样:温度、候选截断 | 从输出分布选择接下来的词元 | 调低温度不能给事实盖章 |
| ⑨外部记忆:检索增强、知识库 | 保存资料,检索后把相关片段送入上下文 | 存了不等于取回;取回也不等于理解或答对 |
| ⑩工具与循环:智能体 | 把调用交给程序执行,读回结果并决定下一步 | 模型说完成不等于动作执行或验收通过 |
| ⑪服务层:接口、队列、超时 | 让客户端按协议请求,管理连接与任务 | 端点就绪不保证请求成功、低延迟或高并发 |
| ⑫边界:许可、权限、可靠性 | 明确能做、允许做及仍需核查的范围 | 开放权重不自动等于任意商用;拒答也不总是能力不足 |
| ⑬评测:样本、评分、验收 | 在明确条件下检查能力和任务完成情况 | 单项高分不能替代你的实际工作验收 |
| ⑭硬件:内存、带宽、算力 | 为权重、缓存和计算提供资源 | 装得下不等于速度够;单一配置无法推断所有任务 |
试着用一分钟定位三个词:量化住在模型压缩这一站;检索增强住在外部资料这一站;智能体住在工具执行与循环这一站。它们可以一起工作,但解决的是三类问题。**量化不能代替查资料,查资料不能代替真的保存文件,保存文件也不能代替验收。**接下来用一封邮件把这张全景图走一遍。
一封邮件,先把“AI”拆开
假设你要发一封催款邮件:“对方逾期10天,欠款8000元,请改得客气一点,金额和日期不能变,不要新增承诺。”这是说明流程的例子,不是一次新实测。
聊天界面先把你的要求、邮件原文,以及需要保留的对话记录组装起来。支持系统指令的产品,还可能放入它自己的行为要求。你屏幕上看到的一句话,并不一定是模型收到的全部内容。
这里就能解释一个常见误会:为什么同一个模型,换个软件突然不听话?模型文件没变,聊天模板、默认指令、截取的历史却可能变了。Hugging Face的聊天模板文档明确提醒,消息角色需要转成模型接受的控制标记,格式错了会损伤表现。聊天模板说明
接着,分词器把文字切成词元,再换成编号。词元可以是词、字或更小的片段,并不是“一个汉字”。模型把编号变成向量,通过多层网络组合前文信息,算出接下来各个词元的候选分数。
采样程序按设定规则选择输出,把新词元接回上下文,再生成后续内容。常见自回归生成会这样逐步推进;屏幕一次跳出几个字,还受传输和界面缓冲影响,不能把屏幕动画当作内部计算次数。

这条链里,分词是编码,网络计算是模型,采样与停止是运行规则。训练则发生在另一阶段:普通聊天推理不会每回答一句,就自动把你说的话永久写进模型权重。产品能保存聊天记录或用户偏好,是另外一层存储。
顺手抓住邮件里最重要的边界:改得更礼貌是生成任务;8000元是否保持、有没有新增付款期限,是验收任务。模型写出一段流畅文字,还不能证明这封邮件能发。
1966年,它只是反问,人却想和它单独聊聊
你大概以为,聊天框对面坐着一个“知道答案”的东西。可“回答很像人”和“理解得像人”,中间隔着一条很长的路。1966年,约瑟夫·魏泽鲍姆发表了ELIZA程序的论文。它通过规则识别输入,把一些话改成反问,便能制造对话感。
ELIZA还有一个耐人寻味的故事:魏泽鲍姆后来回忆,自己的秘书希望与程序单独交谈。他惊讶的不是程序突然理解了人生,而是人这么快就把对话感当成了理解。人的信任,有时会跑在机器真实能力的前面。
今天的模型远比那套规则复杂,这不意味着那条提醒已经过时。它说“我理解你的感受”,首先证明它生成了一句合适的话;能不能保住金额、找到正确文件、兑现一个任务,还得分别看证据。
让一个只记得前一个字的程序,接着写《三字经》
import random
from collections import defaultdict
text = ("人之初,性本善。性相近,习相远。苟不教,性乃迁。教之道,贵以专。"
"昔孟母,择邻处。子不学,断机杼。窦燕山,有义方。教五子,名俱扬。"
"养不教,父之过。教不严,师之惰。")
follow = defaultdict(list) # 记下:每个字后面出现过哪些字
for a, b in zip(text, text[1:]):
follow[a].append(b)
print("“不”后面出现过:", follow["不"])
random.seed(7)
ch = out = "人"
for _ in range(30): # 一个字一个字往下“猜”
ch = random.choice(follow[ch]) # 出现得越多,越容易被抽中
out += ch
print(out)
真实输出:
“不”后面出现过: ['教', '学', '教', '严']
人之道,性本善。性乃迁。苟不严,贵以专。苟不教不严,贵以专。教
“不”后面出现过四次,两次是“教”,所以抽到“教”的机会是一半。它写出来的每一对相邻的字,在原文里都真的出现过——“苟不”“不严”“严,”——可连起来,就成了“苟不严,贵以专”这种似是而非的句子。因为它只看前一个字。
真正的大模型做的是同一件事,只改了两处:它看的不是前一个字,而是前面几千、几万个字;它的“下一个词元表”不是数出来的,而是由一个有几十亿到上万亿个参数的神经网络算出来的。
这段小程序是对照,不是一个微型GPT。它只统计相邻字符;真正语言模型会通过参数与上下文计算更复杂的分布。笑完“苟不严,贵以专”,我们就有了一个具体问题:它保住了局部搭配,为什么保不住整段意思?后面的词元、注意力与训练,接着回答。
都是“猜下一个词”,凭什么能做复杂工作?
把训练目标和最后学到的能力混在一起,是这个问题最容易滑倒的地方。
想接好“这段代码会报错,因为……”,训练中就需要学到代码结构、错误模式和解释方式。为了在大量不同上下文中预测得更好,网络会形成可迁移的规律。它的输出机制仍然是生成词元,但输出可以表达推理步骤、算法、计划和程序。
就像你把“写出下一行正确的解答”作为练习目标,练久了会学到数学关系,不只是练出一种漂亮笔迹。这个比喻只解释目标与能力的区别,不表示模型拥有和人一样的理解或意识。
能力也不是只靠预训练。指令微调让它更像在回答请求,后续训练会影响推理、偏好和安全边界。2017年的Transformer论文提供了注意力架构的重要基础,但今天的产品还包含模型之外的工程系统。Transformer原始论文
对用户来说,最有价值的判断不是“它到底算不算真的懂”,而是:换一种问法、换一份没见过的资料,它还能稳定完成吗?如果只能复述已知答案,遇到新约束就丢条件,能力边界已经露出来了。
搜索、记忆、智能体:别让模型一个人背全部锅
邮件改好之后,你让它“查一下对方公司的最新地址”。这一步需要当前外部信息。支持搜索的产品可以调用工具,把资料带回对话;没调用搜索,仅凭已有参数生成地址,就不该当成已经查实。
你又说“下次都用这个署名”。它能否记住,取决于软件有没有保存偏好,以及下一次有没有把偏好交给模型。一次对话记得住,不代表重新开对话、换账户或换设备还记得住。
最后让它“替我发送”。这就越过了回答,进入工具执行。需要邮件工具、账户权限、收件人确认,还需要发送后的真实状态。一个模型说“已发送”,和发件箱里确实有这封邮件,是两种证据。

本地部署也一样。LocalBrain这样的工具箱负责把模型、语音、工具等连接起来;实际能力要看所选模型、运行引擎和启用的工具。装了一个入口,不等于获得所有模型的全部本领。
把责任拆清之后,排错就有方向了:不知道最新消息先查检索;忘记署名先查历史与记忆;工具没执行先查权限和返回值;越聊越慢再查上下文、缓存和硬件。每次换个更大的模型,未必能修好这些问题,倒可能先把内存填满。
一个真实修错过程:思考、工具、检查怎样接起来
下面不是一张抽象架构图,而是LocalBrain 1.4.6保留的旧界面:模型先检索碰撞检测资料,再写入文件;页面自检报错,编辑一处后又自检,最后显示画布存在、动画帧推进、无控制台错误。界面记录总用时1分30秒、8轮、9次工具、2次失败。仅从这张图,就能分开“模型说了什么”和“工具做了什么”。

截图中,错误是读取了不存在对象的x属性;后续改法先判断对象是否存在,再做碰撞处理。模型生成的解释并没有自行改变文件,真正改变文件的是编辑工具。它说“修好了”之后还要看下一次执行回执,否则只是把希望写成了过去式。
把这个过程拆成四个零件就清楚了。模型负责根据现有证据提出改法;工具把参数变成真实文件操作;检查器报告实际运行状态;代理程序保存历史、决定继续还是停止。它们协作时看起来像一个人,但任何一环坏掉,都可能把答案变成假交付。
五道题里还有一个更难处理的形态:模型的思考已经说要补input字段,发出的参数却仍旧照抄失败文本。后来系统不再把这段错误参数原样留给它抄,而是保留失败事实、把无效调用替换成占位。原记录中的冒烟任务从连续三次超时,变成8轮交付。这个变化发生在执行链,不是偷偷换了一颗更大的模型。
这也解释了为什么“多想一会儿”不是万能修复。分析正确、参数正确、执行成功、验收成立之间,仍有好几道关。你让AI做表格,它可以把公式解释得很漂亮,却写到错误工作表;让它改网站,它可以准确指出问题,却没有保存文件。判断聪明不聪明,最终还得落到动作。
| 环节 | 需要保留的证据 | 典型误判 |
|---|---|---|
| 分析 | 具体错误、原文与改法 | 解释合理,就当作已经解决 |
| 调用 | 工具名、合法参数、授权范围 | 声称会执行,就当作真的执行 |
| 结果 | 工具回执与当前文件 | 写入成功,就当作内容正确 |
| 验收 | 按需求覆盖的独立检查 | 没有报错,就当作功能全对 |
| 更新后 | 新版本重新验证 | 改了一行,继续沿用旧版通过结果 |
当然,自动化也不等于人从此没事干。机器替你写文件,空出的时间可能变成检查文件;替你做了一个页面,接着又想让它做一整套。我现在更愿意把省下来的工作和新增的审核一起算,而不是只算“生成用了多少秒”。

词元、上下文与缓存:一个知识点怎样接到下一个
词元听起来像一节基础课,上下文像另一节,硬件又是第三节。实际使用时,它们是一串因果:文字变成词元,题面、历史和工具回执占据上下文;模型先处理输入,再生成输出;历史状态需要缓存与内存,长任务还可能反复做输入处理。最后落到你身上,就是等待、费用和能不能收尾。
先区分两种速度。预填是读输入,解码是逐步生成输出。你看到模型每秒输出很多词元,未必意味着它能很快交付:发送后先等的时间、工具运行时间、失败重试,以及最后检查文件的时间,都没被一个输出速度数字包进去。
我留存的2026年9月27日深度扫描很适合说明这一点。M5 Pro、Qwen3-8B Q4_K_M、llama.cpp b10357,分别在0、4096、16384、32768的上下文深度生成64词元,每档两次样本。平均生成速度依次54.5、48.9、37.3、28.0词元/秒。模型没有变,深度增加后最后一档约为第一档的51.4%。

这是一个具体配置的结果,不是“所有模型长对话都恰好减半”。可是它足以打破一个误区:上下文窗口只是容量许可,并不是速度承诺。标着能放很长内容,不代表把几十轮失败记录全部塞进去还划算。每轮反复阅读旧错误,既花计算,又可能让模型继续抄错。
五道题的恢复记录里,系统把129446词元的长历史整理到22418,后续能更集中地读取文件、定位错误。这不是把过去全部清空:原始要求、目前产物和必要状态要保住。压缩太激进又会忘记约束,所以“少放点历史”也不是可以不看任务就执行的口诀。
缓存也容易被说成魔法。它可以在条件符合时复用已经计算的前缀,省去一部分重复工作;但前面消息变了、模板变了,或服务重启后原状态没恢复,收益就会变。聊天记忆负责保存与取回信息,计算缓存负责复用计算,两者不是一回事。
| 常见说法 | 遗漏了什么 | 你应该查什么 |
|---|---|---|
| 词元就是字数 | 不同文字、前导空格、分词器会改变切分 | 同一编码器的实际计数与收费口径 |
| 窗口越大越好 | 内存、速度、有效信息密度与恢复成本 | 自己的任务深度、延迟和失败记录 |
| 有记忆就不用重复要求 | 偏好有没有保存、这次有没有取回 | 新对话是否真正带入关键约束 |
| 有缓存就不用再读历史 | 缓存匹配与重启恢复条件 | 服务端实际缓存命中与输入耗时 |
| 本地模型没有成本 | 设备、磁盘、电力、时间与维护 | 端到端耗时、占用和人工返工 |
这就是后面逐期展开的方式:词元接着长度、上下文和费用;上下文接着遗忘、失速与缓存;工具接着权限、执行与验收。第一期先把连接处找出来,第5、9、16、22—26期再分别讲细。你不必今天记住全部参数,先知道自己的问题应该回到哪一层。
“只会猜词”与“什么都懂”,两头都容易把人带偏
第一个误区是把输出机制当成能力上限。模型生成的是词元,可这些词元可以表达代码、数学步骤和工具参数。就像我们在网页题里看见的,短小输出机制可以组合出复杂程序。它需要的能力来自训练学到的规律,不能因为输出接口简单,就把内容也判成简单。
第二个误区恰好相反:会写复杂程序,便以为它理解了全部需求。水墨长卷有画面、有交互,古文却没到字数;城市有车有路,一个加速检查却没过。这说明能力可以很强,也可以在同一任务中出现遗漏。一个亮点不能替其它条件签字。
第三个误区是把流畅当可靠。生成目标会影响表达,但事实真假需要对应外部世界:公司地址要查来源,报价要看日期,文献要打开原文,程序要运行。模型能用同样顺畅的语气说对和说错,所以“它答得很自信”只能描述语气。
第四个误区是把产品入口当模型本领。搜索、读取本地文件、保存偏好、发送邮件,都依赖软件与工具。给模型接了一套工具,能力边界发生变化;没有这些接口,再大的模型也不会仅凭一句话就把硬盘里的文件真正改掉。
第五个误区是把演示通过当长期可靠。一次网页能跑只是样本;工具参数合法不代表业务条件都满足;一分钟成功不代表高峰期、断网、重启后也成功。要把工作真正交出去,至少先验收一个完整任务,再逐步增加长度、复杂度和权限。
对个人来说,这些差别最终影响选择:写一段可自己检查的文案,和让代理替你修改几十个文件,风险不同。钱也不是只分“云端收费、本地免费”。按量计费的一方靠请求与使用量获得收入,硬件与软件各有成本;对你最重要的是哪条路径能用较少的等待、返工和信息暴露完成任务,而不是替某一家站队。
卡住了,先找零件,再找对应的一期
还有一种更实用的找法:不按术语排序,直接按症状找入口。我把常见问题接到这套30期计划上。下面列的是优先检查方向,不是唯一故障原因;同一个症状,可能由不同环节造成。
| 你遇到的症状 | 先查什么 | 对应系列内容 |
|---|---|---|
| 回答很自信,出处却不存在 | 原始资料是否支持主张,不拿自信语气当证据 | 第28期:可靠性与核实 |
| 同样字数,账单却不同 | 分词器、输入输出词元和收费口径 | 第5期:词元与费用 |
| 多想很久,错项还是没少 | 正确率、等待时间与任务收益是否一起改善 | 第9期:推理的代价 |
| 榜单高分,自己的任务却做不完 | 样本和评分是否匹配工作要求 | 第14、24期:评测与体检 |
| 它说文件存好了,实际找不到 | 工具调用、权限、路径及最终读回 | 第26期:工具循环与验收 |
| 参数没变,答案突然发散 | 采样设置、输入模板与软件版本 | 第23、24期:采样与引擎 |
| 下载了模型,软件却不认 | 文件格式、架构支持与转换条件 | 第15、24期:模型包与引擎 |
| 模型能启动,稍长的任务就内存不足 | 权重、缓存、工作缓冲与系统余量 | 第16、22、23期:硬件、缓存与量化 |
| 越聊越慢,重启后又变了 | 上下文深度、缓存命中与恢复条件 | 第16、22期:速度与缓存 |
| 知识库已经放入,答案仍然漏条件 | 本次检索片段是否相关、完整且真正送入模型 | 第25期:知识库与检索 |
| 服务显示就绪,客户端还是超时 | 请求路径、模型加载、排队与服务日志 | 第26期:模型服务 |
| 不知道该选大模型还是小模型 | 自己的任务、可靠性、时间、费用和设备约束 | 第25、30期:选型与最终判断 |
这才是十分钟走完全程的用法:先在全景图中给一个陌生词找位置,再拿一个真实症状找到检查入口,最后对一项任务做验收。今天不要求你掌握全部14个零件;读完以后,能把一次失败拆成几个可检查的问题,就已经比‘再换个模型试试’多走了一步。
30期怎样安排?每一段都对应一件实际的事
看过一次回答和一次交付,现在再看30期计划,每个名字就有了位置。第01—03期交代全景与起源,第04—16期沿原顺序拆开原理,第17—21期走进真实名场面,第22—27期进入实操,第28—30期讨论边界。新模型与热点只在能改变理解或选择时加入,不跟着发布会打乱文章顺序。
| 阶段 | 期数 | 你要解决的问题 |
|---|---|---|
| 全景与起源 | 1—3 | 认识模型与人的期待,回看两次寒冬和开放权重的赛跑 |
| 拆开机器 | 4—16 | 参数、词元、向量、注意力、训练、推理,再接评测与硬件 |
| 名场面 | 17—21 | 用真实突破与失误练判断 |
| 把它用起来 | 22—27 | 部署、缓存、量化、采样、评测、知识库与服务 |
| 边界与选择 | 28—30 | 幻觉、规模与自己的选型 |
按顺序读,你会看见概念怎样一层层接起来;也可以先从正在踩的坑跳进去。账单莫名变大看第5期,模型分数漂亮却办不成事看第14、24、26期,回答不可靠看第28期。下面把30期写清楚,不必为了阅读这个系列先买新设备。
| 期数 | 文章与原文线索 |
|---|---|
| 01 | 你真的懂AI吗?30期纵览:从一次回答,走到模型、评测与本地部署;原文线索:十分钟走完全程;你已经在用它了-大模型到底是什么 |
| 02 | AI经历过2次寒冬,为什么2012年才翻身?显卡、数据和一场比赛的故事;原文线索:三次浪潮与两次寒冬 |
| 03 | GPT-2曾被嫌太危险,6年后又开放权重?一条下载链接背后的AI赛跑;原文线索:开源与闭源的赛跑-2017年至今 |
| 04 | 神经网络真在“动脑”?2个旋钮,拆开机器学习和聊天记忆;原文线索:神经网络到底在算什么 |
| 05 | 同一个strawberry能切成1块或3块?Token、活字印刷和AI的3笔账;原文线索:token-模型眼里的世界 |
| 06 | Embedding相似就答对了?3个词、一个向量空间和知识库的误会;原文线索:语言怎么变成数学 |
| 07 | Transformer能看128K就记得住?2017年的论文和QKV的3个误区;原文线索:Transformer-2017年的那篇论文 |
| 08 | AI会续写却不肯答题?预训练、SFT与偏好优化,3个环节怎样教出助手;原文线索:从预测下一个词到会聊天 |
| 09 | 推理模型多想就更准?从17.7%到78.7%,一张草稿的价值与代价;原文线索:会思考的模型-推理模型在想什么 |
| 10 | AI为什么一个词一个词往外蹦?跟着1次回答,走过分词、注意力和采样;原文线索:一次对话的旅程 |
| 11 | 今天的版图;原文线索:今天的版图 |
| 12 | 被测物是一个配置;原文线索:被测物是一个配置 |
| 13 | 开放的程度-开源许可证与无审查;原文线索:开放的程度-开源许可证与无审查 |
| 14 | 成绩单上的三类数字+基准地图-分数为什么会骗人;原文线索:成绩单上的三类数字;基准地图-分数为什么会骗人 |
| 15 | 打开一个模型文件夹-每个文件都在管什么;原文线索:打开一个模型文件夹-每个文件都在管什么 |
| 16 | 一台电脑能跑多大的模型-内存带宽算力三堵墙+速度是算出来的-从带宽到每秒多少字;原文线索:一台电脑能跑多大的模型-内存带宽算力三堵墙;速度是算出来的-从带宽到每秒多少字 |
| 17 | AlexNet-两块游戏显卡赢下的那场比赛;原文线索:AlexNet-两块游戏显卡赢下的那场比赛 |
| 18 | AlphaGo第37手-人类看不懂的那一步;原文线索:AlphaGo第37手-人类看不懂的那一步 |
| 19 | ChatGPT五天百万用户-一个输入框改变的事;原文线索:ChatGPT五天百万用户-一个输入框改变的事 |
| 20 | 一个开放权重模型让芯片股单日暴跌;原文线索:一个开放权重模型让芯片股单日暴跌 |
| 21 | 一个专为排行榜特调的版本;原文线索:一个专为排行榜特调的版本 |
| 22 | 第一次在自己电脑上跑一个模型+KV-cache显存账本;原文线索:第一次在自己电脑上跑一个模型;KV-cache显存账本 |
| 23 | 量化-给模型压缩体重+采样参数说人话;原文线索:量化-给模型压缩体重;采样参数说人话 |
| 24 | 给你的模型做一次体检+MLX-llama.cpp-vLLM引擎横评;原文线索:给你的模型做一次体检;MLX-llama.cpp-vLLM引擎横评 |
| 25 | 十个模型留谁删谁+知识库外部记忆与RAG;原文线索:十个模型留谁删谁;知识库外部记忆与RAG |
| 26 | 智能体工具记忆与反馈回路+服务化-并发队列健康检查与资源仲裁;原文线索:智能体工具记忆与反馈回路;服务化-并发队列健康检查与资源仲裁 |
| 27 | 给本机出一张能力表;原文线索:给本机出一张能力表 |
| 28 | 幻觉为什么无法根除;原文线索:幻觉为什么无法根除 |
| 29 | 规模法则会不会撞墙;原文线索:规模法则会不会撞墙 |
| 30 | 没有最好的模型;原文线索:没有最好的模型 |
30期会沿着原有顺序展开:先看起源和竞争,再拆原理,随后走进名场面、实操和边界。第4期的网络、第6期的向量、第7期的注意力,会在第10期重新接成一次回答;第8期训练和第9期推理,也会接到后面的评测与可靠性。故事不孤立,概念也不各说各话。
这些是计划,不是已经发表的30篇。每期会配实际例子、常见误区与小练习,适合的地方再加表情包和真实故事;需要公式时给算例,需要结果时交代条件。不承诺每天一篇赶工上线:解释不足、证据不足的时候,先把问题查清,不能把读者当字数验收员。
为什么关注黑粉科技,又为什么要收藏官网?
如果只想解决今天的一件事,前面的文章和工具入口就够你开始;如果想以后自己判断,就沿着这套系列往下读。公众号和官网提供两种读法:一个提醒你重要内容来了,一个让你随时回来把知识和记录查全。
我会继续把官方介绍、本人实测和推断分清,保留对选择有用的失败条件。关注这里得到的应该是判断依据与可用路径,而不是每隔几天被一个“又强了”的形容词催着换模型。
官网与公众号安排同步完整文章,不做一边完整版、一边缩水版。 系列各期、日常文章、自制工具介绍与可公开资源都在同步范围内。官网定期更新全部可公开内容;公众号的系列文章将按“你真的懂AI吗?”合集整理。排版和附件入口可以不同,知识、证据与关键解释不删;私人知识库、凭证和内部日志不在公开范围。
订阅的作用,是不用每次自己想起来再来查。本系列首期安排推送,后续各期继续发布,但不逐篇群发。 另外会定期整理重要变化、值得复看的实测、实用资源与阶段汇总;部分精华不做面向所有人的公开推广,只通过公众号向已关注、订阅的读者推送。关注“黑粉科技”,就是接收这些精选消息与系列提醒的入口。
| 你想怎么读 | 建议入口 | 能获得什么 |
|---|---|---|
| 不想错过重要内容 | 关注并订阅黑粉科技公众号 | 精选推送、重要更新与阶段汇总;不会每篇都群发 |
| 想按顺序补课 | 官网系列目录,及公众号计划整理的“你真的懂AI吗?”合集 | 按期阅读同步的完整正文;后续内容随发布补齐 |
| 遇到问题再来查 | 把hyphentech.top加入浏览器收藏夹 | 完整文章、往期内容、工具与公开资源;定期浏览更新 |
“只向订阅读者推送”说的是消息触达,不是把公开文章加上关注后才能阅读的门锁。公开文章依然可以通过链接阅读;是否每次收到通知,也受微信设置与平台展示影响。你可以用公众号等精选提醒,用官网主动看全量更新,两种方式互相补位。
如果这套讲法对你有用,关注“黑粉科技”,再把黑粉科技官网加入收藏夹。公众号用来接收精选与阶段提醒;官网用来查全量内容、补课和找资源。后续文章与配套资料会随发布持续补齐,值得定期打开,而不只是收藏今天这一篇。电脑浏览器可按Ctrl+D,Mac通常是Command+D;微信里可复制网址到常用浏览器收藏。
今天先做一个小练习:拿一段你可以公开或已脱敏的邮件,列出“要改什么”和“绝不能改什么”,再逐项核对模型的输出。你会发现,流畅、正确和能发出去,需要分别检查。下一期就从这里接着拆:它为什么能把错误写得那么像真的?
查证来源与边界
下一期把时间拨回1958年前后:为什么一个会学习的想法,要穿过两次寒冬才走到今天?
下一篇接着看:1958年,人们已经在期待会学习的机器。几十年后它才真正改变行业。中间不是一条直线上升的曲线,而是承诺、失望,以及老想法终于等到条件的故事。
🧰 我做的工具
这些工具都由我持续维护。预览版会明确标注,下载、更新和已知边界以发行页为准。
信息:黑粉盒子 HyphenBox 状态: 正式迭代
免费大模型 API 雷达:持续复测可用性,本地统一接口,Key 只存本机
信息:方寸智匣 LocalBrain 状态: 正式迭代
本地模型的多模态 MCP 工具箱:TTS / Whisper / 视频生成一站接入
信息:ScreenLex 光影词库 状态: 正式迭代
看美剧顺手把生词背了,Mac/Windows 双平台,免费
信息:黑粉录屏 HyphenScreen 状态: 正式迭代
录屏 + 智能剪辑一体:达芬奇式时间线、自动打码、导出前成片体检,免费
引用:黑粉科技 让AI成为你的超能力 本地部署 · 免费白嫖 · 自制软件 https://hyphentech.top
熬夜烧钱三千字扫码随心一杯茶
微信扫码长按保存图片,用微信「扫一扫」从相册选取


留言
正在加载留言…