快速了解 AI 通用指南
一、先搞懂几个“套娃”概念
AI、机器学习、深度学习,经常被混着说。其实它们是三个套娃,一个比一个小:
- 人工智能(AI) —— 最大的那个娃。意思就是“让机器变得像人一样聪明”。
- 机器学习(ML) —— 中间的娃。它是实现 AI 的主要方法。重点是“学”——不靠人一条条写规则,而是给它看大量例子,让它自己找规律。就像你看了 100 道例题,自然就会做新题,而不是背“解题守则”。
- 深度学习(DL) —— 最小的娃。它模仿人脑神经的结构,特别擅长认图、听声音、读文字。
一句话:AI 是目标,机器学习是方法,深度学习是目前最好用的那套方法。
技术演进:AI 的“三代同堂” AI 不是石头里蹦出来的,它大致走了三步:
- 第一代:专家系统。靠人把知识一条条写成规则(如果…那么…),比如早期医疗诊断系统。缺点是太死板,遇到新情况就傻眼。
- 第二代:传统机器学习。不靠手写规则,而是从数据里“学”出规律,比如垃圾邮件过滤器。缺点是还得靠人手动提取特征(比如教它认猫,得先告诉它“猫有尖耳朵、长胡须”)。
- 第三代:深度学习。连特征提取都不用教了,直接把原始数据(图片像素、声音波形)扔进去,AI 自己一层层抽象出特征。它之所以能崛起,靠三样法宝:海量数据、超强算力、算法突破。
另外,按“能力”还能再切一刀: - 判别式 AI:传统 AI,主要做判断。比如:这是垃圾邮件吗?这张图是猫还是狗? - 生成式 AI:能创造新内容。比如:写一篇邮件、画一只猫、编一段音乐。它主要靠深度学习实现,ChatGPT、Midjourney 都属于此类,是当下最火的方向。
生成式 AI 的三大流派 - GAN(生成对抗网络) :两个 AI 互相“斗法”,一个负责造假,一个负责鉴定,在对抗中共同进步。擅长生成超逼真的图像,如 StyleGAN 生成的人脸。 - VAE(变分自编码器) :先把图像压缩成“精华”,再解压还原。擅长图像的平滑过渡、风格插值。 - 扩散模型:当下主流,通过“先加噪再降噪”来生成图像,是目前画质最高、最稳定的方案。我们会在第三节详细展开。
终极目标:AGI(通用人工智能) 你常听到的 AGI,就是指像人一样什么都能学会、什么都能干的 AI,而不是只会单一技能(如下棋)。目前的 AI 还是“窄人工智能”,达到 AGI 的时间表,全球专家分歧极大,有的预测 3-5 年,有的认为还需要几十年。
二、AI 为什么会聊天?(讲人话版)
你有没有好奇,AI 凭什么能跟你对答如流?
其实它在玩一个超大型的 “猜下一个字” 游戏。
它读了海量的书、网页、对话,记住了“字和字之间怎么搭配最自然”。你问它问题,它就一个字一个字地猜:“这后面最可能接哪个字?”接着猜下一个……连起来就成了一段流畅的回答。
它的底层大脑结构:Transformer 架构 ChatGPT 里的 T 就是这个 Transformer。你可以把它想象成一个超高效的图书馆管理员: - 你问一句话,它能瞬间扫描整本“书”,并给每个字打出“和当前问题有多相关”的分数。 - 核心机制叫自注意力,让 AI 能理解“它”这个字在不同句子里分别指谁,告别了传统模型“看了后面忘了前面”的困境。 - 并行的计算方式让它能同时处理海量数据,训练效率飞升,大模型时代由此开启。
它读的“书”是什么?——训练数据的构成 AI 的“教材”来源极其广泛:全网公开网页、海量电子书、开源代码库、维基百科等知识库、经过筛选的社交对话。不同来源的数据会被配成不同比例,构成 AI 的“知识营养餐”。
“猜字”的进阶:从“温度”调控创造力 AI 猜字时,靠一个叫温度的旋钮来控制“创造力”: - 低温(如 0.2):AI 趋于保守,总是选最稳的字,适合翻译、写代码。 - 高温(如 0.8):AI 胆子更大,会选冷门但有趣的字,适合写诗、头脑风暴。
“猜字”的另一个秘密:Token 是它的最小思考单元 AI 不是按汉字或单词来“看”文本的,而是把文本切成一个个 Token。中文里一个 Token 约等于 1~2 个汉字。它读的书、你发的消息、它的回答,在它眼里都是 Token 串。我们会在第三节详细讲 Token 的计费和消耗逻辑。
“一个字一个字地猜”其实还有一层秘密:词嵌入 在 AI 的“大脑”里,每个词都被表示成一个固定长度的向量,即一串数字。这串数字就像这个词的“坐标”,意思相近的词,坐标也挨得近。比如“国王”和“王后”、“苹果”和“香蕉”,在 AI 的向量空间里都离得很近。这样 AI 就能“理解”词与词之间的关系。
这也解释了一个现象——AI 有时会一本正经地胡说八道(行话叫“幻觉”)。因为它本质是在“猜最像样的答案”,而不是真的“知道”对错。所以它说的话,重要的内容你要自己核实一下。
三、几个你一定会听到的词
-
Token(词元)—— AI 的“字” AI 看文字,不是一个字一个字看,而是切成一小块一小块来处理,每一块叫一个 Token。 你可以把它理解成 AI 的“流量”或“电费” :你跟它聊得越多、它回答得越长,消耗的 Token 就越多。很多 AI 收费就是按 Token 算的。 粗略记:中文里,1 个 Token 大概相当于 1~2 个汉字(不同 AI 略有差别)。 要注意的是,Token 消耗包含了你发送的整个对话历史,每次提问都会把之前的对话重新发送一遍,因此长对话成本会越来越高。
-
知识蒸馏——“大模型带小模型” 大模型像个经验丰富的教授,小模型像个勤奋的学生。教授不直接告诉学生对错,而是把“思考逻辑”传给小模型。 为什么要这么做?大模型太胖了——跑得慢、耗电大、手机装不下。蒸馏后的小模型保留了关键知识,瘦身成功,跑得更快,性能还接近大模型。
-
上下文窗口—— AI 的“短期记忆” 指 AI 一次能记住多少内容。窗口越大,它能“读”的文章越长。就像有人能一口气记住一整章,有人看两段就忘了前面。 目前主流模型窗口已达百万级 Token,能一次塞进整本《三体》三部曲。
-
AI Agent(智能体)—— “有手有脚的 AI”
- 普通 AI 像个只会动嘴的顾问:你问它怎么订票,它告诉你步骤。
- 智能体像个能帮你跑腿的助理:你说“帮我订张回家的票”,它自己去查、去比价、去下单。 区别就一句:普通 AI 你让它干啥它干啥;智能体你给它目标,它自己想办法搞定。
-
算力—— AI 的“力气” 人靠吃饭有力气思考,AI 靠“算力”来思考。你每发一句话、每生成一张图,背后都有一堆芯片在拼命计算。算力越强,AI 想得越快越好。 衡量单位叫 FLOPS(每秒浮点运算次数):
- 1 TFLOPS = 每秒 1 万亿次计算
- 1 PFLOPS = 每秒 1000 万亿次计算(≈500 台高性能计算机 1 秒生成 2000 张 AI 高清图片) “一度算力” 是个新概念——就像电费按“度”收,算力也可以按“度”买。定义为 312 TFLOPS × 1 小时,用多少付多少,不用为闲置硬件买单。 算力的核心硬件——AI 芯片
- GPU:最开始为打游戏设计的显卡,后来发现它的并行计算能力特别适合 AI。英伟达 H100 是目前训练大模型的“标配显卡”,单块售价数万美元。
- NPU/TPU:专门为 AI 计算定制的芯片,比 GPU 更专用、更省电。用在手机、边缘设备上,让你离线也能跑 AI。
- 显存:可以理解为 AI 的“工作台”。显存越大,AI 一次能处理的任务越复杂。 产业链条: 芯片 → 服务器 → 数据中心 → 网络互联 → 调度平台和算法框架
-
OPC(一人公司)—— “一个人就是一家公司” OPC = 个人 + AI智能体 + 算力 + 数据。一个人借助 AI,就能完成从产品设计、研发到市场投放的全部工作。 为什么突然火了?因为 AI 成了能主动干活的“数字员工”。竞争的核心不再是“谁技术强”,而是谁能最快想到好点子,并让 AI 帮他干出来。 政策也在推:2026 年广东发布全国首个省级 OPC 政策,目标 2028 年培育 1000 家标杆 OPC 企业。全国已有 23 个城市给 OPC 发补贴——算力券单个主体最高 2000 万元。 算力是汽油,Token 是里程,OPC 是用最少的“人”+AI 跑最远的“路”的司机。
-
RAG(检索增强生成)—— 从“闭卷”变“开卷” 普通 AI 答题像闭卷考试,全靠脑子记,容易记错。用了 RAG,它会先查资料再回答,相当于开卷考试,答案更靠谱。 实现 RAG 的关键技术:向量数据库 它不像传统数据库那样按关键词匹配,而是把文字转成“向量”(一串代表语义的数字坐标),然后比较语义的相似度来检索。你问“怎么让手机更省电”,它能匹配到“延长电池续航的方法”,即使字面上完全不一样,但意思相近,它就能找到。
-
MCP(模型上下文协议)—— AI 的“USB-C 接口” Anthropic 推出的开源协议,让 AI 能统一对接各种外部工具。不管插什么“设备”(数据库、API、文件系统),都用同一个“接口”。
-
提示工程(Prompt)—— “会问”比“会用”更重要 同样一个 AI,你问得好不好,结果天差地别。 比如别只说“帮我写作文”,而说“帮我写一篇 600 字、关于环保、适合初中生、有具体例子的作文”——这就是提示工程,说白了就是把话讲清楚,把条件、格式、语气明确告诉它。
-
大语言模型(LLM)—— 聊天 AI 的大脑 你聊天的对象,本质上就是一个大语言模型。它在超大规模文本数据上训练出来,参数越多,“脑容量”越大。它又分:
- 预训练:让模型在海量文本上“读书识字”,学会语法的基本规律和世界常识。这一步最烧钱,训练一次动辄千万美元。
- 基座模型:只完成基础“阅读”训练的通用模型,还不太会聊天。
- 微调模型:给基座模型看很多“标准问答对”,从“只会接话”变成“会当助手”。
- RLHF(人类反馈强化学习):训练师给 AI 的多个回答打分,它反复揣摩,学会生成更符合人类的、安全有用的回答。这是 ChatGPT 聪明的关键。 主流模型对比一览
- GPT-5:OpenAI 出品,多模态深度融合,推理能力全面,综合标杆。
- Claude 4:Anthropic 出品,超长上下文(百万级 Token),强调安全无害。
- DeepSeek-V3:深度求索出品,开源模型,推理强,API 价格极有竞争力。
- Gemini 3:谷歌出品,原生多模态,与谷歌搜索生态深度融合。
- 通义千问 3:阿里出品,中文能力强,电商、企业级场景丰富。
-
扩散模型—— 画图 AI 的灵魂 图像生成主要靠它。原理就像:先在一张图上不断撒“雪花”,直到变成一团噪点;再让 AI 学习如何从噪点一步步“还原”出清晰图像。你给一句话,它就把这句话当线索,从噪点中“画”出你想要的图。Midjourney、Stable Diffusion、DALL·E 3 是代表。
-
多模态—— 让 AI 长“眼睛”和“耳朵” 早期的 AI 只处理文字,现在的 AI 能同时理解文字、图像、声音、视频等多种信息。给它一张财报图表,它能分析数据;给它一段会议录音,它能整理摘要。多模态还让 AI 之间能“互相教学”:比如先用图训练视觉模型,再用它来教文本模型更好地理解世界,最终让纯文本模型的逻辑推理能力也变强了。
-
涌现能力—— “量变引起质变”的魔法 模型不够大时,它很笨。当参数规模超过某个临界点,一些新能力会突然“涌现”。比如思维链(一步步推理)和上下文学习(看几个例子立刻学会新任务),科学家还没完全搞懂原理。
-
思维链—— 教 AI“打草稿” 一种提问技巧。不问“答案是什么”,而问“请一步步推理,最后给出答案”。这能强制 AI 模拟思考过程,在数学和逻辑题上正确率飙升。更高级的还有“思维树”,让 AI 同时探索多种推理路径,择优选择,处理复杂任务能力更强。
-
微调—— AI 的“岗前培训” 不是从零造 AI,而是拿一个“通才”模型,用特定数据(如医疗对话、法律文书)给它做培训,低成本变成“专才”。微调时一个棘手的问题是“灾难性遗忘”——AI 学了新知识就忘了旧能力。通常会把新旧数据混合训练来缓解。
-
MoE(混合专家模型)—— 让大模型“减负增效”的架构 把一个大模型拆成多个“专家”小模型,每次处理任务时,只激活相关的几位专家,而不是整个大脑一起转。好处是计算量大幅下降,推理更快。缺点是需要更多显存来装载所有专家。DeepSeek-V3 就是 MoE 模型的代表,激活参数只有总量的几分之一,性能却很强。
-
量化—— AI 模型的“压缩瘦身” 把 AI 模型的“精度”从高精度降下来,比如从 32 位浮点数降到 8 位甚至 4 位整数。好比把一张高清照片转成 JPG,画质略有损失,但文件体积大幅缩小,手机也能跑大模型了。
-
输入 / 输出 —— AI 的“耳朵”和“嘴巴” 这是最基础的概念,但很多人不好意思问。输入就是你给 AI 的东西:你打的字、上传的图、发给它的语音,都是输入。输出就是 AI 返回给你的结果:它生成的文字回答、画出的图、合成的语音。如果把 AI 比作一个人,输入就是它听到、看到的东西,输出就是它说出来、写出来的东西。一切 AI 工具说到底,都是“接收输入 → 内部处理 → 给出输出”。
-
沙箱 —— AI 的“安全围栏” 你可以把沙箱理解成一个完全隔离开的“沙地游乐场”。AI 智能体在里面可以随便玩——创建文件、上网搜索、执行代码——但无论它怎么折腾,都跑不出这个游乐场,影响不到外面的真实系统。就像你给小孩一个沙盘,他可以随便堆沙子、挖洞,但不会把客厅弄脏。当 AI 需要操作电脑、执行可能有风险的任务时,通常会被放进沙箱里运行,这样就算它出错或干了傻事,也不会删掉你的重要文件或搞崩系统。
-
agent.md —— 智能体的“个人档案” 这是一个文件名,很多 AI 智能体项目里都会有一个
agent.md。你可以把它想象成智能体的“人设说明书”。这个文件里通常写着:- 这个智能体是谁(比如“你是一个资深运维工程师”)
- 它的目标是什么(比如“自动排查服务器故障”)
- 它能用哪些工具(比如“可以执行 shell 命令、查询数据库”)
- 它要遵守什么规则(比如“修改配置前必须先备份”) 有了这份档案,智能体就知道自己该干什么、能干什么、不能干什么,就像一个员工拿到了岗位说明书。
四、常见的 AI 工具有哪些?
聊天问答类(最常用)
| 地区 | 工具 | 特点 |
|---|---|---|
| 国外 | ChatGPT | 综合能力最强,深度研究/语音好 |
| 国外 | Claude | 写作和编程特别强 |
| 国外 | Gemini | 图像视频生成强 |
| 国内 | 豆包 | 用的人最多,中文体验稳定 |
| 国内 | DeepSeek | 很会推理,免费开源 |
| 国内 | Kimi | 能读超长文档(200万字),写论文查资料神器 |
| 国内 | 通义千问 | 阿里出品,深度集成阿里云 |
| 国内 | 文心一言 | 百度出品,融合搜索生态 |
写代码类(如果你学编程会用到)
| 地区 | 工具 | 特点 |
|---|---|---|
| 国外 | GitHub Copilot | 业界最成熟,GitHub 亲儿子 |
| 国外 | Cursor | AI 原生 IDE,用起来最顺滑 |
| 国外 | Amazon Q | AWS 云开发首选 |
| 国内 | 通义灵码 | 阿里出品,支持私域知识库 |
| 国内 | CodeBuddy | 腾讯出品,双模型驱动 |
| 国内 | Trae | 字节出品,中文设计稿直接变代码 |
| 国内 | CodeGeeX | 完全免费,国产开源 |
| 国内 | Qoder | 阿里系 |
2026 年,全球 46% 的新增代码已经由 AI 生成。程序员的角色正在从“写代码”变成“审阅 AI 写的代码”。
画图/设计类
| 地区 | 工具 | 特点 |
|---|---|---|
| 国外 | Midjourney | 艺术感最强,设计师最爱 |
| 国外 | DALL·E 3 | 与 ChatGPT 深度集成,精准理解复杂指令 |
| 国外 | Stable Diffusion | 完全开源,可控性最高,可私有部署 |
| 国内 | 文心一格 | 百度出品,中文理解好 |
| 国内 | 通义万相 | 阿里出品,电商/营销素材多 |
视频/音频类
| 地区 | 工具 | 特点 |
|---|---|---|
| 国外 | Sora | OpenAI 出品,文生视频标杆 |
| 国外 | Runway Gen-4 | 视频编辑+生成,影视行业用得多 |
| 国内 | 可灵 AI | 快手出品,视频生成质量高 |
| 国内 | 剪映 AI | 字节出品,AI 剪辑+配音+字幕 |
| 国内 | 即梦/SeenDance | 字节系 |
搜索/研究类
| 地区 | 工具 | 特点 |
|---|---|---|
| 国外 | Perplexity | AI 原生搜索引擎,回答带来源链接 |
| 国外 | Google AI Overviews | 谷歌搜索内置 AI 摘要 |
| 国内 | 秘塔 AI 搜索 | 学术搜索,自动整理文献综述 |
办公/职场类
| 地区 | 工具 | 特点 |
|---|---|---|
| 国外 | Microsoft 365 Copilot | Word/Excel/PPT 全集成 |
| 国外 | Notion AI | 笔记+文档+项目管理,AI 写作助手 |
| 国内 | WPS AI | 金山出品,更适合中文办公场景 |
| 国内 | 钉钉 AI/飞书 AI | 办公软件内置,自动整理会议纪要 |
运维/DevOps 类(实习即会用)
| 地区 | 工具 | 特点 |
|---|---|---|
| 国外 | Datadog AI | 智能告警、自动根因分析,少看报警风暴 |
| 国外 | PagerDuty AIOps | 事件智能分派、噪声压制,值班更高效 |
| 国外 | GitHub Copilot for CLI | 在终端里用自然语言生成命令,告别死记参数 |
| 国外 | Warp | AI 原生终端,智能补全、解释报错、记住工作流 |
| 国内 | 阿里云 AIOps | 异常检测、容量预测、智能巡检,云上标配 |
| 国内 | 腾讯云智维 AI | 智能告警聚合、故障自愈,与蓝鲸体系集成 |
五、进阶版 AI 编程工具(智能体型)
前面那些是“帮你写代码”,下面这些是“替你干活”——它们已经从工具进化成了智能体:
| 工具 | 出品方 | 一句话定位 | 核心特色 |
|---|---|---|---|
| Cursor | Anysphere | AI 原生 IDE 标杆 | 最早把 AI 深度融入 IDE,有云端自主智能体 |
| Trae | 字节跳动 | “真·AI 工程师” | 覆盖写代码→调试→部署全流程,有 SOLO 自动开发模式 |
| Qoder | 阿里云 | “自动驾驶”开发平台 | 你只负责提需求,AI 自己执行、验证、交付 |
| CodeBuddy | 腾讯云 | 企业级 AI 开发环境 | 强制 AI 遵循你的编码规范,支持自定义智能体 |
| WorkBuddy | 腾讯云 | 全场景职场 AI 智能体 | 不只是写代码,还能帮你处理文件、操作电脑 |
选哪个?一句话建议: - 想尝鲜选 Cursor - 想要全免费、全流程选 Trae - 想体验“动嘴就能写代码”选 Qoder - 企业或团队用选 CodeBuddy - 想找个 AI 同事帮你干杂活选 WorkBuddy
更多细分领域工具
- 设计转代码:说一句话或给张设计稿,直接出网页。
- Dora AI:输入文字,生成炫酷的 3D 交互动画网站。
- Locofy:Figma 设计稿一键转前端代码。
- 即时 AI:国内版,支持 Figma/Sketch/即时设计转代码。
- AI 编码智能体:能独立完成项目的“数字程序员”。
- Devin:全球首个 AI 软件工程师,会自己规划、编码、调试、部署。
- 操作自动化:能直接帮你操作浏览器和电脑桌面的 AI。
- Browser-use:开源框架,AI 能自己在浏览器上完成任何任务。
- UIPath AI Agents:企业级流程自动化(RPA)的 AI 进化版。
六、怎么用 AI?(在哪都能用)
- 网页版:打开网站就能用,最省事,适合新手先试。
- 手机 App:随时随地问。
- 电脑客户端:更顺手,适合认真干活。
- IDE 插件:写代码时直接用,无缝集成。
- 终端 CLI:适合自动化脚本、批量处理。
- API 调用:适合开发者把 AI 集成到自己的系统里。
- IM 内嵌:飞书 AI、钉钉 AI,办公软件里直接叫出来用。
- AI 电脑/浏览器:未来形态,AI 是操作系统的一部分。
- Microsoft Copilot:深度集成在 Windows 和 Edge 里,系统级助手。
- Goblin Surfer:AI 浏览器,核心交互就是跟 AI 说话。
新手建议:先从网页版或手机 App 开始,别一上来就折腾复杂的安装。
七、AI 智能体双雄:小龙虾 vs 爱马仕
智能体的“单兵作战”与“集团军协作”
我们前面说的智能体大多是一个 AI 在干活。但实际应用中,更常见的是多智能体协作: - 单智能体:一个 AI 身兼数职,适合流程明确、目标单一的任务。 - 多智能体系统:一个“项目经理”AI 把大任务拆解,分给“程序员”、“设计师”、“测试员”等不同角色 AI,彼此还能审查、辩论、打回重做。目前主流框架有微软的 AutoGen 和开源的 CrewAI。
OpenClaw(小龙虾)—— “有手有脚的 AI”
它是什么? 一个能直接帮你操作电脑的 AI 智能体,奥地利程序员打造,免费开源。
普通 AI 只会说——“你应该这样做”。 小龙虾会直接做——自动整理文件、帮你填表单、抓取数据、发消息……它搭载了 5700 多个技能,支持微信、钉钉、飞书等 50 多个平台。
你说“帮我生成一份报告,下午 4 点发到部门群”,它自己就全部搞定了。
但风险也不小:它权限很高,万一误操作可能“一秒搬空数据”;Token 消耗也猛,有人一个月用了 3 万元。安装门槛也高,专业同事有时都要折腾好几天。
Hermes(爱马仕)—— “会自我进化的 AI”
它是什么? 2026 年 2 月发布的 AI 智能体,口号是“与你共同成长的智能体”。
它和小龙虾最大的区别——学习能力:
| 对比 | 小龙虾(OpenClaw) | 爱马仕(Hermes) |
|---|---|---|
| 学习方式 | 会话结束就重置 | 从每次任务中总结,越用越聪明 |
| 技能来源 | 你手动安装 | AI 自己生成技能 |
| 记忆 | 啥都记,Token 消耗大 | 只记精华,效率越用越高 |
一句话:小龙虾是“装好工具再去干活”,爱马仕是“干着活自己长出新工具”。
市场表现很猛:GitHub 星标 14 万(一个月翻倍),每天消耗 2710 亿 Token,反超小龙虾登顶全球第一。
凑热闹的Marvis
全球热门智能体一览
| 项目 | 出品方 | 一句话定位 |
|---|---|---|
| NanoClaw | 社区 | 小龙虾的安全精简版(代码只有 500 行) |
| ZeroClaw | 社区 | 小龙虾的轻量嵌入式版(用 Rust 写,体积小) |
| OpenCode | 社区 | GitHub 星标超 17 万,编码智能体的明星 |
| Goose | Linux 基金会 | 官方托管,通用智能体 |
| Agent Zero | 社区 | 专注自主进化的智能体 |
| StepClaw | 阶跃星辰 | 云端+本地混合架构 |
| LobsterAI | 网易有道 | 本地优先,注重隐私安全 |
| Claude Computer Use | Anthropic | 官方出品,沙箱化桌面自动化 |
| Manus | 字节跳动 | 通用任务执行智能体,能操作网站、分析数据、编写报告 |
| 千问 App | 阿里 | 手机上的智能体助手,能跨应用完成复杂操作 |
其他特色智能体
- GameAgent(游戏智能体):能在游戏中扮演玩家或 NPC,理解游戏规则并做出策略决策。代表有英伟达的 Voyager。
- HyperWrite:个人 AI 助手,能记住你的写作风格和偏好,自动续写、改写、总结,像你的专属编辑。
- OmniParser:微软出品的屏幕解析工具,让 AI 能“看懂”电脑屏幕上的任意界面,是智能体操作电脑的基础组件。
健康医疗 AI
- AI 健康助手:如丁香园的 AI 问诊、左手医生的症状自查,能做初步健康咨询,但不能替代医生诊断。
- AI 药物研发:AlphaFold 预测蛋白质结构,加速靶点发现和药物设计,传统需要数年的研发周期有望缩短到数月。
八、Skill(技能)—— 让 AI 变成“专家”的说明书
Skill 是什么?
它就是一个文件夹,里面写着“AI 应该怎么完成某一类特定任务”的指令。有了它,你就不需要每次都给 AI 重新解释一遍“我要你怎么做”。
比如你装了一个“会议总结 Skill”,以后 AI 输出的会议纪要就永远按照“参会人员→议题→决定→待办”的格式来。
Skill 让 AI 的输出从“随机应变”变成“有章可循”。
Skill 的三个层次
- 公共 Skill:社区共享的通用规则,如“周报生成器”、“代码审查员”。
- 个人 Skill:你自己定制的独特工作流,融入你的写作风格、思维习惯、工作场景。
- Skill 的历史记忆:高级 Skill 会长期记住你的偏好和习惯,持续进化。例如一个“我的播客 Skill”,会记住你喜欢的结构、语气、开头音乐,每次都按你的风格来。
怎么安装?
- 用命令行工具:
npm install -g @sstar/skill-install - 或者手动下载,放到 AI 指定的 skills 目录下
Skill 的进阶:从“小工具”到“应用商店”
Skill 正像手机 App 一样,演变成一种生态。 - 官方商店化: - ChatGPT GPTs:OpenAI 官方商店,用户能创建并分享定制版 ChatGPT,甚至赚取收入。 - 阿里云百炼平台:可定义和发布包含知识库、工作流的商业级 AI 应用。 - Workflow(工作流):更复杂的“Skill 组合”,像工厂流水线。可设定“先由 A 处理,再由 B 审核,最后 C 输出”的流程。Dify 和 LangChain 就是搭这种工作流的常用框架。
AI 的记忆系统
- 短期记忆:就是上下文窗口,对话结束就清空,临时记事本。
- 长期记忆:把重要信息持久存储,跨会话记住你的偏好。通常结合向量数据库实现,让 AI 在很多次对话后依然记得你是谁、喜欢什么。
扩展
在 八、Skill(技能)—— 让 AI 变成“专家”的说明书 章节末尾,现有的“Skill的进阶:从‘小工具’到‘应用商店’”之后,新增以下小节:
Skill 的进阶:工作流(Workflow)
工作流是什么?
如果说 Skill 是“单步操作说明书”,那工作流就是“多步操作流水线”——它把多个 Skill 或 AI 调用按照特定顺序串起来,形成一个完整的自动化流程。
打个比方: - Skill 像一台咖啡机:按一个按钮,出一杯咖啡。 - 工作流 像一条咖啡生产线:先磨豆 → 再萃取 → 然后打奶泡 → 最后装杯。每一步都有专门的工序,顺序不能乱。
Skill vs 工作流 vs Agent(智能体)
很多初学者会混淆这三个概念,用一张表说清楚:
| 概念 | 核心特点 | 适用场景 | 类比 |
|---|---|---|---|
| Skill(技能) | 给AI写一份“操作说明书”,告诉它某种特定任务该怎么做 | 输出格式固定、反复使用的任务,如“周报生成器” | 一个菜谱 |
| Workflow(工作流) | 把多个步骤串成流水线,按顺序执行,每步的输出是下一步的输入 | 需要多步处理的复杂任务,如“自动爬数据 → 清洗 → 生成报告” | 一条生产线 |
| Agent(智能体) | AI自己决策“下一步做什么”,能根据中间结果灵活调整,甚至调用工具 | 任务不固定、需要自主规划的复杂场景 | 一个能随机应变的厨师 |
更直观的区别: - Skill:你把“每一步怎么做”都写好,AI照着执行。 - Workflow:你把“整个流程”设计好,系统自动跑完所有步骤。 - Agent:你只给一个“目标”,AI自己拆解步骤、选工具、调整策略。
工作流的常见应用场景
- 内容生产流水线:
- 步骤1:AI搜索最新行业资讯
- 步骤2:AI根据资讯生成文章初稿
- 步骤3:AI对文章进行润色和校对
- 步骤4:AI自动排版并发布到公众号
- 数据处理流水线:
- 步骤1:AI读取Excel原始数据
- 步骤2:AI进行数据清洗和格式转换
- 步骤3:AI生成数据可视化图表
- 步骤4:AI自动发送报告邮件给相关人员
- 代码开发流水线:
- 步骤1:AI根据需求生成代码
- 步骤2:AI自动运行单元测试
- 步骤3:若测试失败,AI自动修复代码
- 步骤4:AI生成代码审查报告
搭建工作流的常用工具
- Dify:拖拽式搭建AI工作流,适合非技术人员快速上手
- LangChain:代码化构建工作流,适合开发者深度定制
- n8n / Zapier:通用的自动化工作流工具,可集成AI能力
- Coze(扣子) :字节出品,支持工作流编排和Bot发布
一句话总结:
Skill 是“怎么做好一件事”的说明书,Workflow 是“怎么完成一个项目”的流水线,Agent 是“自己决定怎么完成任务”的智能体。三者从简单到复杂,从“手把手教”到“放手让它干”。
补充关联:在工作流和智能体的运行中,往往还需要记忆系统的支撑——短期记忆(上下文窗口)让AI记住当前对话的来龙去脉,长期记忆(向量数据库)让AI跨会话记住用户的偏好和历史。三者常配合使用,共同构成一个完整的AI应用。
LangChain 是构建 AI 应用(尤其是智能体)的核心框架,可以把它理解为一个 “AI 应用的操作系统”或“乐高积木”
九、学生该练哪些“硬本事”?
AI 越强,下面这几点反而越值钱,我们把它提炼成一个 “五力模型”,这正是 AI 替代不了的核心能力:
- 【会用】AI 工具力:知道什么问题找什么 AI,能写明白提示词,让 AI 帮你提速,而不是替你思考。比如让它给你讲懂一道题,比直接抄答案有用一百倍。
- 【能判】批判性思维:AI 会犯错,会一本正经地胡说八道。你得有自己的判断,用它给的答案去反查一手资料,不盲信。
- 【会想】创造性思维:AI 负责把点子可视化、文本化,你负责追问“为什么?”和“能不能换个角度?”。想出真正的新点子,还是人的事。
- 【懂人】同理心与协作力:理解用户的真实需求,感知团队伙伴的情绪,这是人与人协作的根本,AI 无法体会。
- 【善学】元学习能力:AI 更新极快,知道自己该怎么学一个新工具、新领域,并快速上手。习惯不断学新东西的人,最不容易被淘汰。
2026 年世界经济论坛《未来就业报告》指出,到 2030 年,AI 将替代约 9200 万个岗位,但同时将创造 1.7 亿个新岗位,净增 7800 万。掌握 AI 协作能力将成为最核心的就业竞争力。
十、一张图记住整个流程
芯片出力气(算力)→ 力气变成 AI 能读的“字”(Token)→ 大模型猜字、组织答案 → 智能体动手帮你干活 → 产出文章/图片/代码 → 一个人+AI 跑通整条路(OPC)
打个比方: - 算力是汽油——AI 运转的底层动力 - 大模型是发动机——把汽油转化成动力 - Token是跑过的里程——你用得越多,跑得越远 - 智能体是司机——帮你规划路线、踩油门、打方向盘 - Skill是导航地图——告诉司机走哪条路最靠谱 - OPC是司机自己开公司——一个人+AI,跑出整条产业链
十一、当前大趋势与挑战(了解就行)
趋势
- 中国算力规模世界第二,“算电协同”首次写入 2026 年政府工作报告。
- 全国 23 个城市出台“一人公司(OPC)”扶持政策,算力券最高 2000 万元。
- AI 智能体正从“能干活”(小龙虾)向“会进化”(爱马仕)演进。
- 全球近一半新代码由 AI 生成(46%)。
- 端侧 AI:模型直接跑在手机/电脑芯片上,不用联网,更快、更省电、更隐私。
- 科学 AI:AI 正加速科学发现。DeepMind 的 AlphaFold 已预测几乎全部蛋白质结构,用于新药研发。
- 具身智能:给 AI 大脑配上机器人身体,在物理世界中执行任务,是 AI 的终极形态之一。
- AI 合成数据:互联网真实数据快不够用了,开始用 AI 生成的数据来训练新 AI。
AI 界的“路线之争”
- 开源 vs 闭源:以 Meta(Llama 模型)和 DeepSeek 为代表的开源阵营认为开源能加速创新;以 OpenAI 和 Google 为代表的闭源阵营认为闭源更安全、更能保证商业可持续。
- Scaling Law(规模定律)是否遇到天花板? 过去“算力越大、数据越多,模型越聪明”的规律似乎开始放缓。接下来是继续堆算力(做更大),还是改进算法架构(做更巧),业内分歧极大。
- 世界模型:让 AI 不仅处理语言和图像,还能理解物理世界的因果规律,具备常识推理能力,被认为是通往 AGI 的关键一步。
资本与市场
- 2025 年全球 AI 投资总额超 2000 亿美元,其中算力基础设施占比最大。
- 全球 AI 产业正从“模型军备竞赛”转向“应用生态建设”,投资人更关注“你的 AI 怎么赚钱”。
- AI 相关岗位薪资溢价明显:国内 AI 工程师平均薪资比同级别传统工程师高 30%–50%。
挑战与争议
- 能源消耗:大模型训练和运行极其耗电,一个大型数据中心年耗电量堪比小型城市。
- 数据隐私:你用 AI 时输入的每一句话都可能被用于改进模型。部分厂商提供“对话不用于训练”的选项,但默认设置下,谨慎对待敏感信息是最稳妥的做法。
- 版权与伦理:AI 用他人作品训练是否侵权?生成的内容归谁?AI 换脸诈骗怎么办?法律还在追。
- 就业结构冲击:低创意、高重复性的任务容易被取代;人与 AI 协作、解决复杂问题的岗位变得更重要。
- AI 安全与对齐:如何确保越来越聪明的 AI,其目标和价值观始终与人类一致,是全球顶尖实验室正在攻关的核心难题。
十二、计算机学生就业实战指南(通用版)
这一章是专门写给要走出校门的同学的,不堆术语,只说面试、实习、入职后真正会碰到的东西。开发、运维、测试等方向均可参考。
1. 岗位的“新分类”(所有方向)
AI 时代,计算机学生的就业岗位正在重新洗牌,但不必焦虑——核心是“原来的岗位 + AI 能力”:
| 岗位方向 | 原来的定义 | 现在的新要求 |
|---|---|---|
| 应用开发 | 写 Java/Python/前端 | 会调大模型 API、搭 RAG、用 LangChain |
| 算法/研究 | 训模型、推公式 | 一样,但更强调工程化部署和轻量化 |
| 运维/SRE | 管服务器、写脚本、7×24 值班 | 用 AI 辅助排障、写运维脚本、智能告警分析 |
| 测试/QA | 手工/自动化测试 | 用 AI 生成测试用例、自动做回归测试 |
| 数据工程 | ETL、SQL | 会用大模型做数据清洗、打标签、合成训练数据 |
| 安全 | 渗透、防御 | 用 AI 做威胁分析、异常行为检测、自动响应 |
| 产品经理 | 画原型、写 PRD | 懂大模型边界,能设计 AI 产品的交互和评估体系 |
一句话:所有岗位的 JD 里都开始出现“了解大模型”“有 AI 项目经验”这样的字眼。
2. 各个方向必知必会的技术栈
面试或实习时,你会发现公司做的不是“从零训练模型”,而是“用模型搭应用/保稳定/找 Bug”。各方向最常碰到的框架,知道名字和用途即可:
开发方向
| 框架 | 用途 | 一句话 |
|---|---|---|
| LangChain | 大模型应用开发框架 | 搭 AI 应用的“脚手架”,串起 LLM、数据库、工具 |
| LlamaIndex | 数据索引框架 | 专注做 RAG,把文档变成可检索的知识库 |
| Dify | 低代码 AI 平台 | 拖拽式搭 AI 工作流,中小公司最爱 |
| FastAPI | 高性能 Web 框架 | 给 AI 模型包一层 API,Python 后端首选 |
| vLLM | 推理加速 | 让大模型跑得更快更省显存,部署必用 |
| Streamlit/Gradio | 快速 Demo | 几行代码出界面,给老板演示用 |
运维方向
| 框架/工具 | 用途 | 一句话 |
|---|---|---|
| Docker/K8s | 容器化与编排 | 大模型部署的标配,GPU 资源调度全靠它 |
| Prometheus + Grafana | 监控 | 监控 GPU 使用率、API 延迟、Token 消耗 |
| Datadog AIOps | 智能运维 | 自动去噪告警、根因分析,减少 MTTR |
| Ollama | 本地模型运行 | 在本机快速起一个开源模型,测试、学习神器 |
| Ansible/ Terraform | 自动化与 IaC | AI 帮你写 playbook 和模板,但你要会审 |
| Warp | AI 原生终端 | 用自然语言写命令、解释报错,运维效率翻倍 |
测试方向
| 框架/工具 | 用途 | 一句话 |
|---|---|---|
| Selenium + AI | 自动化测试 | AI 帮你生成测试脚本、自动修复失效的定位器 |
| Playwright + AI | 端到端测试 | 同上,微软出品,更强 |
| Applitools | 视觉测试 | AI 自动检测界面像素级差异,不用人肉对比 |
面试常问:不管你面哪个方向,都可能被问到“你怎么用 AI 提效?”“你了解 RAG 吗?”“大模型部署要注意什么?”——不需要精通,但要能用自己的话讲清楚。
3. 各方向面试最可能碰到的实操概念
| 概念 | 开发方向怎么答 | 运维方向怎么答 | 测试方向怎么答 |
|---|---|---|---|
| RAG | “先查后答,外挂知识库,减少幻觉” | “要维护向量库的稳定,关注检索延迟和数据新鲜度” | “AI 先检索文档再生成答案,测试重点在于召回率和答案准确性” |
| 向量数据库 | “存文本向量,做语义搜索” | “要监控索引构建开销,保障高并发低延迟” | “验证相似度阈值对结果的影响,边缘 case 多测” |
| 模型幻觉 | “加 RAG、限制温度、明确说不知道” | “幻觉会导致错误决策,要在关键链路加人工审核” | “构造对抗样本,测试模型在边界问题上的表现” |
| 流式输出 | “用 SSE 实现打字机效果,体验好” | “反向代理要支持长连接,监控连接数和超时” | “测试流中断、网络抖动下的表现” |
| 模型部署 | “用 vLLM/TGI,调显存和并发” | “做灰度发布、自动扩缩容、GPU 资源池化管理” | “验证灰度期间新旧模型的一致性和回滚策略” |
4. 项目中常见的坑(和对应的亮点做法)
无论什么方向,面试官都看过太多烂大街的项目。以下是大忌和加分项,通用性极高:
| ❌ 减分项 | ✅ 加分项 |
|---|---|
| “我调了个 API 做了个聊天机器人” | “我给学校图书馆做了个 AI 问答,能指定检索范围,答不出时说不知道” |
| 代码无注释、无 README | README 有架构图、有快速开始、写了遇到的坑 |
| 没考虑成本和滥用 | 加了缓存策略、速率限制、输入过滤 |
| 只做功能,不考虑“挂了怎么办” | 做了健康检查、降级方案、重要操作留日志 |
一个好的学生项目 = 真实痛点 + 技术选型讲得出理由 + 考虑了错误处理 + 文档清晰
5. 进入职场前的“最小行动清单”(不分方向)
大二/大三就能做的事 1. 注册 GitHub,上传至少一个项目(哪怕只是课程设计 AI 版) 2. 学会用 Git(clone、commit、push、pull request 就行) 3. 在笔记本上用 Ollama 跑一次开源模型(部署方向尤其重要) 4. 把 ChatGPT/Claude/DeepSeek 的 API 都调一遍,对比感受 5. 用 LangChain 搭一个带 RAG 的问答系统(开发/测试都适用)
大三暑假实习前 6. 背熟一个自己项目的完整介绍(为什么做、怎么设计、遇到什么坑、效果如何) 7. 准备几个系统设计面试题: - 开发:“怎么设计一个 AI 客服系统?” - 运维:“怎么设计一个能自动扩缩容的模型推理服务?” - 测试:“怎么测试一个 AI 问答系统的质量?” 8. 在 LeetCode 刷 100 道高频题(所有技术岗都考算法) 9. 注册一个技术博客账号(知乎/掘金/CSDN),尝试写一篇 AI 学习笔记——面试官如果能搜到,会非常加分
6. AI 应用的经典架构图(开发和运维通用)
这张图建议记在脑子里,面试时画给面试官看,能讲清每个模块的作用,你就超过 80% 的竞争者:
用户端 (Web/App)
│
▼
API 网关 (鉴权、限流、路由)
│
├──────▶ 应用层 (LangChain / 自研逻辑)
│ │
│ ├──▶ 大模型 API (GPT/DeepSeek 等)
│ │
│ ├──▶ 向量数据库 (Milvus/Weaviate)
│ │
│ └──▶ 缓存层 (Redis)
│
└──────▶ 监控 & 日志 (Prometheus + Grafana + ELK)
│
└──▶ 告警 & 值班 (PagerDuty/飞书通知)
开发岗能讲应用层和模型调用,运维岗能讲网关、监控和部署,测试岗能讲在这个链路上怎么埋测试点。各方向都说得出东西。
最后的建议(给每一位同学): 面试官不指望应届生精通所有东西,但他们希望看到: - 你会主动学(有项目、有博客、有好奇心) - 你能把复杂问题讲清楚(图 + 人话 + 代码/配置示例) - 你知道企业不是做研究,而是做产品/保服务(成本、稳定性、可观测性)
把这份指南看完,挑一个你最感兴趣的方向,真正动手做一个小项目,你就能自信地走进任何一家科技公司的面试间。
学生常见的十大疑问(及解答)
| 疑问 | 解答 |
|---|---|
| AI会取代我的工作吗? | 会改变工作方式,但创造新岗位;学会用AI的人比不会用的更有竞争力 |
| AI有情感吗? | 没有,它只是模仿语言模式,不理解“喜怒哀乐” |
| AI为什么有时胡说八道? | 因为它基于概率,不是真理;而且训练数据可能带有错误或偏见 |
| 我用AI写作业算作弊吗? | 如果直接用AI生成而不思考,算抄袭;如果用来辅助理解、理清思路,是合理工具 |
| 大模型会记住我的隐私吗? | 一般不主动记录,但你的对话可能被用于改进模型(谨慎输入敏感信息) |
| AI能画图,那设计师会失业吗? | 初级设计可能被替代,但创意和审美仍是人类优势 |
| 为什么国内AI和国外有差距? | 数据、算力、开源生态等方面有差异,但差距在缩小 |
| 我要学编程吗? | 学编程能帮你更好理解AI原理,但未来“自然语言编程”会降低门槛,逻辑思维更重要 |
| AI能自我进化吗? | 目前不会,它靠人类改进;但像Hermes这类能记忆和优化任务流程,算“有限进化” |
| 我该怎么开始学AI? | 从“用”开始——注册一个ChatGPT或DeepSeek,每天问10个问题,两周后你就会有感觉 |
Comments NOTHING