AI 世界地图

基础 · 01 / 04

刚接触 AI 的时候,最晕的不是不会用,是分不清谁是谁——豆包到底是个 App 还是个模型? Claude 和 Claude Code 什么关系?Skills 和 Agent 是一回事吗? 这些问题解不开,是因为它们本来就不在同一层。把三层叠起来看,一眼就清楚了。

第三层 应用 你打字的那个东西

一个壳。它自己不会思考,只负责把你的话转给下面的模型,再把结果摆给你看。 换掉里面的模型,壳还是那个壳。

判断方法:你在哪个界面里打字,那就是应用。

能碰你电脑上的文件(Agent 型)
Claude Code需网络工具
Anthropic。能读写文件、跑命令、连着做很多步。装 Skills 就在这类工具里。
Codex需网络工具
OpenAI。定位和上面基本一样,界面更省事。
WorkBuddy国内直连
腾讯。同样能读写本地文件,不需要网络工具,网络不稳时的保底选择。
只聊天,不碰你的文件
豆包国内直连
字节。手机和网页都有,日常问答最顺手的国内入口。
ChatGPT / Claude 网页版需网络工具
对话为主。上传文件可以,但改不了你硬盘上的东西。
专做一件事的工作台
Midjourney需网络工具
只做图。网页里输入提示词出图,我们那门古风课用的就是它。
LibTV国内直连
LiblibAI 出的视频工作台。剧本 → 分镜 → 视频,节点式画布。
应用调用模型 —— 一个应用可以随时换模型,一个模型也能被很多应用同时调用。 两者是可插拔的,不是绑死的。
第二层 模型 真正在算的引擎

干活的那个。你看不见它,它没有界面。所有的理解、生成、推理都发生在这一层。 模型分家族,每个家族下面还有一堆型号,型号大致对应「多聪明、多贵、多快」。

判断方法:它在算,不在显示。

文本 / 多模态 —— 读文字、写文字,多数也能看图
GPT 系
OpenAI
Claude 系
Anthropic
Gemini 系
Google
豆包系
字节
DeepSeek 系
深度求索 · 开源
Qwen 系
阿里 · 开源
图像 —— 文字进,图出
Midjourney
审美最稳,我们古风课用的
Seedream
字节
Nano Banana
Google · 擅长在原图上改
Flux
开源生态最大
视频 —— 文字或图进,会动的东西出
Seedance
字节
Kling 可灵
快手
Veo
Google
Sora
OpenAI

型号每季度都在换,这里只记家族名。要具体到版本号,上课时现查。

模型由这些机制构成 —— 下面这些名词不是另一类东西, 是描述「模型怎么工作、怎么计价、怎么被你指挥」的零件。
第一层 机制 你会听到的那些名词

零件和规则。这些词本身不是产品,是用来描述上面两层怎么运作的。 听懂这六个,AI 圈九成的话你就能听明白了。

判断方法:它不是个东西,是个说法。

token
AI 读写文字的最小单位。中文一个字大约 1–2 个 token。贵不贵、能记多少,全按它算。
上下文窗口
它一次能同时「看到」多少 token。超出去,最前面的内容就被挤掉了——聊久了它开始忘事,就是这个原因。
Prompt 提示词
你说的那段话。说得越具体,它猜得越少。整门古风课练的就是这个。
Skills
给 AI 的一本工作手册。装上之后,你说人话,它自己判断该翻到哪一页,按里面的规矩干活。
Agent
会自己动手的 AI。不只回答,还能读写文件、跑命令、连着做很多步再回来交差。
MCP
给 AI 插的外接口,让它能连你的网盘、日历、数据库。Skills 是教它怎么做,MCP 是让它够得着。
同名陷阱 同一个名字,在两层里指的不是一回事
Claude
在模型层Anthropic 的模型家族,别的产品也能调用它。
在应用层Claude 网页版 / 桌面版 / Claude Code,三个不同的壳,里面装的是同一批模型。
豆包
在模型层字节的模型家族,很多第三方产品接的就是它。
在应用层你手机上那个豆包 App。
Midjourney
在模型层一个图像模型,LibTV 这类平台里也能选到它。
在应用层midjourney.com 那个网页,是它自己的壳。

分辨的办法只有一句话:问它是在算,还是在显示。 在算的是模型,在显示的是应用。名字撞车不重要,层不会撞。

读完了就点一下。只是给你自己一个收尾,不是考核。