快速了解 AI 通用指南

发布于 2 小时前 4 次阅读


快速了解 AI 通用指南


一、先搞懂几个“套娃”概念

AI、机器学习、深度学习,经常被混着说。其实它们是三个套娃,一个比一个小:

  • 人工智能(AI) —— 最大的那个娃。意思就是“让机器变得像人一样聪明”。
  • 机器学习(ML) —— 中间的娃。它是实现 AI 的主要方法。重点是“学”——不靠人一条条写规则,而是给它看大量例子,让它自己找规律。就像你看了 100 道例题,自然就会做新题,而不是背“解题守则”。
  • 深度学习(DL) —— 最小的娃。它模仿人脑神经的结构,特别擅长认图、听声音、读文字。

一句话:AI 是目标,机器学习是方法,深度学习是目前最好用的那套方法。

技术演进:AI 的“三代同堂” AI 不是石头里蹦出来的,它大致走了三步:

  • 第一代:专家系统。靠人把知识一条条写成规则(如果…那么…),比如早期医疗诊断系统。缺点是太死板,遇到新情况就傻眼。
  • 第二代:传统机器学习。不靠手写规则,而是从数据里“学”出规律,比如垃圾邮件过滤器。缺点是还得靠人手动提取特征(比如教它认猫,得先告诉它“猫有尖耳朵、长胡须”)。
  • 第三代:深度学习。连特征提取都不用教了,直接把原始数据(图片像素、声音波形)扔进去,AI 自己一层层抽象出特征。它之所以能崛起,靠三样法宝:海量数据、超强算力、算法突破

另外,按“能力”还能再切一刀: - 判别式 AI:传统 AI,主要做判断。比如:这是垃圾邮件吗?这张图是猫还是狗? - 生成式 AI:能创造新内容。比如:写一篇邮件、画一只猫、编一段音乐。它主要靠深度学习实现,ChatGPT、Midjourney 都属于此类,是当下最火的方向。

生成式 AI 的三大流派 - GAN(生成对抗网络) :两个 AI 互相“斗法”,一个负责造假,一个负责鉴定,在对抗中共同进步。擅长生成超逼真的图像,如 StyleGAN 生成的人脸。 - VAE(变分自编码器) :先把图像压缩成“精华”,再解压还原。擅长图像的平滑过渡、风格插值。 - 扩散模型:当下主流,通过“先加噪再降噪”来生成图像,是目前画质最高、最稳定的方案。我们会在第三节详细展开。

终极目标:AGI(通用人工智能) 你常听到的 AGI,就是指像人一样什么都能学会、什么都能干的 AI,而不是只会单一技能(如下棋)。目前的 AI 还是“窄人工智能”,达到 AGI 的时间表,全球专家分歧极大,有的预测 3-5 年,有的认为还需要几十年。


二、AI 为什么会聊天?(讲人话版)

你有没有好奇,AI 凭什么能跟你对答如流?

其实它在玩一个超大型的 “猜下一个字” 游戏。

它读了海量的书、网页、对话,记住了“字和字之间怎么搭配最自然”。你问它问题,它就一个字一个字地猜:“这后面最可能接哪个字?”接着猜下一个……连起来就成了一段流畅的回答。

它的底层大脑结构:Transformer 架构 ChatGPT 里的 T 就是这个 Transformer。你可以把它想象成一个超高效的图书馆管理员: - 你问一句话,它能瞬间扫描整本“书”,并给每个字打出“和当前问题有多相关”的分数。 - 核心机制叫自注意力,让 AI 能理解“它”这个字在不同句子里分别指谁,告别了传统模型“看了后面忘了前面”的困境。 - 并行的计算方式让它能同时处理海量数据,训练效率飞升,大模型时代由此开启。

它读的“书”是什么?——训练数据的构成 AI 的“教材”来源极其广泛:全网公开网页、海量电子书、开源代码库、维基百科等知识库、经过筛选的社交对话。不同来源的数据会被配成不同比例,构成 AI 的“知识营养餐”。

“猜字”的进阶:从“温度”调控创造力 AI 猜字时,靠一个叫温度的旋钮来控制“创造力”: - 低温(如 0.2):AI 趋于保守,总是选最稳的字,适合翻译、写代码。 - 高温(如 0.8):AI 胆子更大,会选冷门但有趣的字,适合写诗、头脑风暴。

“猜字”的另一个秘密:Token 是它的最小思考单元 AI 不是按汉字或单词来“看”文本的,而是把文本切成一个个 Token。中文里一个 Token 约等于 1~2 个汉字。它读的书、你发的消息、它的回答,在它眼里都是 Token 串。我们会在第三节详细讲 Token 的计费和消耗逻辑。

“一个字一个字地猜”其实还有一层秘密:词嵌入 在 AI 的“大脑”里,每个词都被表示成一个固定长度的向量,即一串数字。这串数字就像这个词的“坐标”,意思相近的词,坐标也挨得近。比如“国王”和“王后”、“苹果”和“香蕉”,在 AI 的向量空间里都离得很近。这样 AI 就能“理解”词与词之间的关系。

这也解释了一个现象——AI 有时会一本正经地胡说八道(行话叫“幻觉”)。因为它本质是在“猜最像样的答案”,而不是真的“知道”对错。所以它说的话,重要的内容你要自己核实一下。


三、几个你一定会听到的词

  1. Token(词元)—— AI 的“字” AI 看文字,不是一个字一个字看,而是切成一小块一小块来处理,每一块叫一个 Token。 你可以把它理解成 AI 的“流量”或“电费” :你跟它聊得越多、它回答得越长,消耗的 Token 就越多。很多 AI 收费就是按 Token 算的。 粗略记:中文里,1 个 Token 大概相当于 1~2 个汉字(不同 AI 略有差别)。 要注意的是,Token 消耗包含了你发送的整个对话历史,每次提问都会把之前的对话重新发送一遍,因此长对话成本会越来越高。

  2. 知识蒸馏——“大模型带小模型” 大模型像个经验丰富的教授,小模型像个勤奋的学生。教授不直接告诉学生对错,而是把“思考逻辑”传给小模型。 为什么要这么做?大模型太胖了——跑得慢、耗电大、手机装不下。蒸馏后的小模型保留了关键知识,瘦身成功,跑得更快,性能还接近大模型。

  3. 上下文窗口—— AI 的“短期记忆” 指 AI 一次能记住多少内容。窗口越大,它能“读”的文章越长。就像有人能一口气记住一整章,有人看两段就忘了前面。 目前主流模型窗口已达百万级 Token,能一次塞进整本《三体》三部曲。

  4. AI Agent(智能体)—— “有手有脚的 AI”

    • 普通 AI 像个只会动嘴的顾问:你问它怎么订票,它告诉你步骤。
    • 智能体像个能帮你跑腿的助理:你说“帮我订张回家的票”,它自己去查、去比价、去下单。 区别就一句:普通 AI 你让它干啥它干啥;智能体你给它目标,它自己想办法搞定。
  5. 算力—— AI 的“力气” 人靠吃饭有力气思考,AI 靠“算力”来思考。你每发一句话、每生成一张图,背后都有一堆芯片在拼命计算。算力越强,AI 想得越快越好。 衡量单位叫 FLOPS(每秒浮点运算次数):

    • 1 TFLOPS = 每秒 1 万亿次计算
    • 1 PFLOPS = 每秒 1000 万亿次计算(≈500 台高性能计算机 1 秒生成 2000 张 AI 高清图片) “一度算力” 是个新概念——就像电费按“度”收,算力也可以按“度”买。定义为 312 TFLOPS × 1 小时,用多少付多少,不用为闲置硬件买单。 算力的核心硬件——AI 芯片
    • GPU:最开始为打游戏设计的显卡,后来发现它的并行计算能力特别适合 AI。英伟达 H100 是目前训练大模型的“标配显卡”,单块售价数万美元。
    • NPU/TPU:专门为 AI 计算定制的芯片,比 GPU 更专用、更省电。用在手机、边缘设备上,让你离线也能跑 AI。
    • 显存:可以理解为 AI 的“工作台”。显存越大,AI 一次能处理的任务越复杂。 产业链条: 芯片 → 服务器 → 数据中心 → 网络互联 → 调度平台和算法框架
  6. OPC(一人公司)—— “一个人就是一家公司” OPC = 个人 + AI智能体 + 算力 + 数据。一个人借助 AI,就能完成从产品设计、研发到市场投放的全部工作。 为什么突然火了?因为 AI 成了能主动干活的“数字员工”。竞争的核心不再是“谁技术强”,而是谁能最快想到好点子,并让 AI 帮他干出来。 政策也在推:2026 年广东发布全国首个省级 OPC 政策,目标 2028 年培育 1000 家标杆 OPC 企业。全国已有 23 个城市给 OPC 发补贴——算力券单个主体最高 2000 万元。 算力是汽油,Token 是里程,OPC 是用最少的“人”+AI 跑最远的“路”的司机。

  7. RAG(检索增强生成)—— 从“闭卷”变“开卷” 普通 AI 答题像闭卷考试,全靠脑子记,容易记错。用了 RAG,它会先查资料再回答,相当于开卷考试,答案更靠谱。 实现 RAG 的关键技术:向量数据库 它不像传统数据库那样按关键词匹配,而是把文字转成“向量”(一串代表语义的数字坐标),然后比较语义的相似度来检索。你问“怎么让手机更省电”,它能匹配到“延长电池续航的方法”,即使字面上完全不一样,但意思相近,它就能找到。

  8. MCP(模型上下文协议)—— AI 的“USB-C 接口” Anthropic 推出的开源协议,让 AI 能统一对接各种外部工具。不管插什么“设备”(数据库、API、文件系统),都用同一个“接口”。

  9. 提示工程(Prompt)—— “会问”比“会用”更重要 同样一个 AI,你问得好不好,结果天差地别。 比如别只说“帮我写作文”,而说“帮我写一篇 600 字、关于环保、适合初中生、有具体例子的作文”——这就是提示工程,说白了就是把话讲清楚,把条件、格式、语气明确告诉它。

  10. 大语言模型(LLM)—— 聊天 AI 的大脑 你聊天的对象,本质上就是一个大语言模型。它在超大规模文本数据上训练出来,参数越多,“脑容量”越大。它又分:

    • 预训练:让模型在海量文本上“读书识字”,学会语法的基本规律和世界常识。这一步最烧钱,训练一次动辄千万美元。
    • 基座模型:只完成基础“阅读”训练的通用模型,还不太会聊天。
    • 微调模型:给基座模型看很多“标准问答对”,从“只会接话”变成“会当助手”。
    • RLHF(人类反馈强化学习):训练师给 AI 的多个回答打分,它反复揣摩,学会生成更符合人类的、安全有用的回答。这是 ChatGPT 聪明的关键。 主流模型对比一览
    • GPT-5:OpenAI 出品,多模态深度融合,推理能力全面,综合标杆。
    • Claude 4:Anthropic 出品,超长上下文(百万级 Token),强调安全无害。
    • DeepSeek-V3:深度求索出品,开源模型,推理强,API 价格极有竞争力。
    • Gemini 3:谷歌出品,原生多模态,与谷歌搜索生态深度融合。
    • 通义千问 3:阿里出品,中文能力强,电商、企业级场景丰富。
  11. 扩散模型—— 画图 AI 的灵魂 图像生成主要靠它。原理就像:先在一张图上不断撒“雪花”,直到变成一团噪点;再让 AI 学习如何从噪点一步步“还原”出清晰图像。你给一句话,它就把这句话当线索,从噪点中“画”出你想要的图。Midjourney、Stable Diffusion、DALL·E 3 是代表。

  12. 多模态—— 让 AI 长“眼睛”和“耳朵” 早期的 AI 只处理文字,现在的 AI 能同时理解文字、图像、声音、视频等多种信息。给它一张财报图表,它能分析数据;给它一段会议录音,它能整理摘要。多模态还让 AI 之间能“互相教学”:比如先用图训练视觉模型,再用它来教文本模型更好地理解世界,最终让纯文本模型的逻辑推理能力也变强了。

  13. 涌现能力—— “量变引起质变”的魔法 模型不够大时,它很笨。当参数规模超过某个临界点,一些新能力会突然“涌现”。比如思维链(一步步推理)和上下文学习(看几个例子立刻学会新任务),科学家还没完全搞懂原理。

  14. 思维链—— 教 AI“打草稿” 一种提问技巧。不问“答案是什么”,而问“请一步步推理,最后给出答案”。这能强制 AI 模拟思考过程,在数学和逻辑题上正确率飙升。更高级的还有“思维树”,让 AI 同时探索多种推理路径,择优选择,处理复杂任务能力更强。

  15. 微调—— AI 的“岗前培训” 不是从零造 AI,而是拿一个“通才”模型,用特定数据(如医疗对话、法律文书)给它做培训,低成本变成“专才”。微调时一个棘手的问题是“灾难性遗忘”——AI 学了新知识就忘了旧能力。通常会把新旧数据混合训练来缓解。

  16. MoE(混合专家模型)—— 让大模型“减负增效”的架构 把一个大模型拆成多个“专家”小模型,每次处理任务时,只激活相关的几位专家,而不是整个大脑一起转。好处是计算量大幅下降,推理更快。缺点是需要更多显存来装载所有专家。DeepSeek-V3 就是 MoE 模型的代表,激活参数只有总量的几分之一,性能却很强。

  17. 量化—— AI 模型的“压缩瘦身” 把 AI 模型的“精度”从高精度降下来,比如从 32 位浮点数降到 8 位甚至 4 位整数。好比把一张高清照片转成 JPG,画质略有损失,但文件体积大幅缩小,手机也能跑大模型了。

  18. 输入 / 输出 —— AI 的“耳朵”和“嘴巴” 这是最基础的概念,但很多人不好意思问。输入就是你给 AI 的东西:你打的字、上传的图、发给它的语音,都是输入。输出就是 AI 返回给你的结果:它生成的文字回答、画出的图、合成的语音。如果把 AI 比作一个人,输入就是它听到、看到的东西,输出就是它说出来、写出来的东西。一切 AI 工具说到底,都是“接收输入 → 内部处理 → 给出输出”。

  19. 沙箱 —— AI 的“安全围栏” 你可以把沙箱理解成一个完全隔离开的“沙地游乐场”。AI 智能体在里面可以随便玩——创建文件、上网搜索、执行代码——但无论它怎么折腾,都跑不出这个游乐场,影响不到外面的真实系统。就像你给小孩一个沙盘,他可以随便堆沙子、挖洞,但不会把客厅弄脏。当 AI 需要操作电脑、执行可能有风险的任务时,通常会被放进沙箱里运行,这样就算它出错或干了傻事,也不会删掉你的重要文件或搞崩系统。

  20. agent.md —— 智能体的“个人档案” 这是一个文件名,很多 AI 智能体项目里都会有一个 agent.md。你可以把它想象成智能体的“人设说明书”。这个文件里通常写着:

    • 这个智能体是谁(比如“你是一个资深运维工程师”)
    • 它的目标是什么(比如“自动排查服务器故障”)
    • 它能用哪些工具(比如“可以执行 shell 命令、查询数据库”)
    • 它要遵守什么规则(比如“修改配置前必须先备份”) 有了这份档案,智能体就知道自己该干什么、能干什么、不能干什么,就像一个员工拿到了岗位说明书。

四、常见的 AI 工具有哪些?

聊天问答类(最常用)

地区 工具 特点
国外 ChatGPT 综合能力最强,深度研究/语音好
国外 Claude 写作和编程特别强
国外 Gemini 图像视频生成强
国内 豆包 用的人最多,中文体验稳定
国内 DeepSeek 很会推理,免费开源
国内 Kimi 能读超长文档(200万字),写论文查资料神器
国内 通义千问 阿里出品,深度集成阿里云
国内 文心一言 百度出品,融合搜索生态

写代码类(如果你学编程会用到)

地区 工具 特点
国外 GitHub Copilot 业界最成熟,GitHub 亲儿子
国外 Cursor AI 原生 IDE,用起来最顺滑
国外 Amazon Q AWS 云开发首选
国内 通义灵码 阿里出品,支持私域知识库
国内 CodeBuddy 腾讯出品,双模型驱动
国内 Trae 字节出品,中文设计稿直接变代码
国内 CodeGeeX 完全免费,国产开源
国内 Qoder 阿里系

2026 年,全球 46% 的新增代码已经由 AI 生成。程序员的角色正在从“写代码”变成“审阅 AI 写的代码”。

画图/设计类

地区 工具 特点
国外 Midjourney 艺术感最强,设计师最爱
国外 DALL·E 3 与 ChatGPT 深度集成,精准理解复杂指令
国外 Stable Diffusion 完全开源,可控性最高,可私有部署
国内 文心一格 百度出品,中文理解好
国内 通义万相 阿里出品,电商/营销素材多

视频/音频类

地区 工具 特点
国外 Sora OpenAI 出品,文生视频标杆
国外 Runway Gen-4 视频编辑+生成,影视行业用得多
国内 可灵 AI 快手出品,视频生成质量高
国内 剪映 AI 字节出品,AI 剪辑+配音+字幕
国内 即梦/SeenDance 字节系

搜索/研究类

地区 工具 特点
国外 Perplexity AI 原生搜索引擎,回答带来源链接
国外 Google AI Overviews 谷歌搜索内置 AI 摘要
国内 秘塔 AI 搜索 学术搜索,自动整理文献综述

办公/职场类

地区 工具 特点
国外 Microsoft 365 Copilot Word/Excel/PPT 全集成
国外 Notion AI 笔记+文档+项目管理,AI 写作助手
国内 WPS AI 金山出品,更适合中文办公场景
国内 钉钉 AI/飞书 AI 办公软件内置,自动整理会议纪要

运维/DevOps 类(实习即会用)

地区 工具 特点
国外 Datadog AI 智能告警、自动根因分析,少看报警风暴
国外 PagerDuty AIOps 事件智能分派、噪声压制,值班更高效
国外 GitHub Copilot for CLI 在终端里用自然语言生成命令,告别死记参数
国外 Warp AI 原生终端,智能补全、解释报错、记住工作流
国内 阿里云 AIOps 异常检测、容量预测、智能巡检,云上标配
国内 腾讯云智维 AI 智能告警聚合、故障自愈,与蓝鲸体系集成

五、进阶版 AI 编程工具(智能体型)

前面那些是“帮你写代码”,下面这些是“替你干活”——它们已经从工具进化成了智能体:

工具 出品方 一句话定位 核心特色
Cursor Anysphere AI 原生 IDE 标杆 最早把 AI 深度融入 IDE,有云端自主智能体
Trae 字节跳动 “真·AI 工程师” 覆盖写代码→调试→部署全流程,有 SOLO 自动开发模式
Qoder 阿里云 “自动驾驶”开发平台 你只负责提需求,AI 自己执行、验证、交付
CodeBuddy 腾讯云 企业级 AI 开发环境 强制 AI 遵循你的编码规范,支持自定义智能体
WorkBuddy 腾讯云 全场景职场 AI 智能体 不只是写代码,还能帮你处理文件、操作电脑

选哪个?一句话建议: - 想尝鲜选 Cursor - 想要全免费、全流程选 Trae - 想体验“动嘴就能写代码”选 Qoder - 企业或团队用选 CodeBuddy - 想找个 AI 同事帮你干杂活选 WorkBuddy

更多细分领域工具

  • 设计转代码:说一句话或给张设计稿,直接出网页。
    • Dora AI:输入文字,生成炫酷的 3D 交互动画网站。
    • Locofy:Figma 设计稿一键转前端代码。
    • 即时 AI:国内版,支持 Figma/Sketch/即时设计转代码。
  • AI 编码智能体:能独立完成项目的“数字程序员”。
    • Devin:全球首个 AI 软件工程师,会自己规划、编码、调试、部署。
  • 操作自动化:能直接帮你操作浏览器和电脑桌面的 AI。
    • Browser-use:开源框架,AI 能自己在浏览器上完成任何任务。
    • UIPath AI Agents:企业级流程自动化(RPA)的 AI 进化版。

六、怎么用 AI?(在哪都能用)

  • 网页版:打开网站就能用,最省事,适合新手先试。
  • 手机 App:随时随地问。
  • 电脑客户端:更顺手,适合认真干活。
  • IDE 插件:写代码时直接用,无缝集成。
  • 终端 CLI:适合自动化脚本、批量处理。
  • API 调用:适合开发者把 AI 集成到自己的系统里。
  • IM 内嵌:飞书 AI、钉钉 AI,办公软件里直接叫出来用。
  • AI 电脑/浏览器:未来形态,AI 是操作系统的一部分。
    • Microsoft Copilot:深度集成在 Windows 和 Edge 里,系统级助手。
    • Goblin Surfer:AI 浏览器,核心交互就是跟 AI 说话。

新手建议:先从网页版或手机 App 开始,别一上来就折腾复杂的安装。


七、AI 智能体双雄:小龙虾 vs 爱马仕

智能体的“单兵作战”与“集团军协作”

我们前面说的智能体大多是一个 AI 在干活。但实际应用中,更常见的是多智能体协作: - 单智能体:一个 AI 身兼数职,适合流程明确、目标单一的任务。 - 多智能体系统:一个“项目经理”AI 把大任务拆解,分给“程序员”、“设计师”、“测试员”等不同角色 AI,彼此还能审查、辩论、打回重做。目前主流框架有微软的 AutoGen 和开源的 CrewAI

OpenClaw(小龙虾)—— “有手有脚的 AI”

它是什么? 一个能直接帮你操作电脑的 AI 智能体,奥地利程序员打造,免费开源。

普通 AI 只会说——“你应该这样做”。 小龙虾会直接做——自动整理文件、帮你填表单、抓取数据、发消息……它搭载了 5700 多个技能,支持微信、钉钉、飞书等 50 多个平台。

你说“帮我生成一份报告,下午 4 点发到部门群”,它自己就全部搞定了。

但风险也不小:它权限很高,万一误操作可能“一秒搬空数据”;Token 消耗也猛,有人一个月用了 3 万元。安装门槛也高,专业同事有时都要折腾好几天。

Hermes(爱马仕)—— “会自我进化的 AI”

它是什么? 2026 年 2 月发布的 AI 智能体,口号是“与你共同成长的智能体”。

它和小龙虾最大的区别——学习能力:

对比 小龙虾(OpenClaw) 爱马仕(Hermes)
学习方式 会话结束就重置 从每次任务中总结,越用越聪明
技能来源 你手动安装 AI 自己生成技能
记忆 啥都记,Token 消耗大 只记精华,效率越用越高

一句话:小龙虾是“装好工具再去干活”,爱马仕是“干着活自己长出新工具”。

市场表现很猛:GitHub 星标 14 万(一个月翻倍),每天消耗 2710 亿 Token,反超小龙虾登顶全球第一。

凑热闹的Marvis

全球热门智能体一览

项目 出品方 一句话定位
NanoClaw 社区 小龙虾的安全精简版(代码只有 500 行)
ZeroClaw 社区 小龙虾的轻量嵌入式版(用 Rust 写,体积小)
OpenCode 社区 GitHub 星标超 17 万,编码智能体的明星
Goose Linux 基金会 官方托管,通用智能体
Agent Zero 社区 专注自主进化的智能体
StepClaw 阶跃星辰 云端+本地混合架构
LobsterAI 网易有道 本地优先,注重隐私安全
Claude Computer Use Anthropic 官方出品,沙箱化桌面自动化
Manus 字节跳动 通用任务执行智能体,能操作网站、分析数据、编写报告
千问 App 阿里 手机上的智能体助手,能跨应用完成复杂操作

其他特色智能体

  • GameAgent(游戏智能体):能在游戏中扮演玩家或 NPC,理解游戏规则并做出策略决策。代表有英伟达的 Voyager。
  • HyperWrite:个人 AI 助手,能记住你的写作风格和偏好,自动续写、改写、总结,像你的专属编辑。
  • OmniParser:微软出品的屏幕解析工具,让 AI 能“看懂”电脑屏幕上的任意界面,是智能体操作电脑的基础组件。

健康医疗 AI

  • AI 健康助手:如丁香园的 AI 问诊、左手医生的症状自查,能做初步健康咨询,但不能替代医生诊断
  • AI 药物研发:AlphaFold 预测蛋白质结构,加速靶点发现和药物设计,传统需要数年的研发周期有望缩短到数月。

八、Skill(技能)—— 让 AI 变成“专家”的说明书

Skill 是什么?

它就是一个文件夹,里面写着“AI 应该怎么完成某一类特定任务”的指令。有了它,你就不需要每次都给 AI 重新解释一遍“我要你怎么做”。

比如你装了一个“会议总结 Skill”,以后 AI 输出的会议纪要就永远按照“参会人员→议题→决定→待办”的格式来。

Skill 让 AI 的输出从“随机应变”变成“有章可循”。

Skill 的三个层次

  • 公共 Skill:社区共享的通用规则,如“周报生成器”、“代码审查员”。
  • 个人 Skill:你自己定制的独特工作流,融入你的写作风格、思维习惯、工作场景。
  • Skill 的历史记忆:高级 Skill 会长期记住你的偏好和习惯,持续进化。例如一个“我的播客 Skill”,会记住你喜欢的结构、语气、开头音乐,每次都按你的风格来。

怎么安装?

  • 用命令行工具:npm install -g @sstar/skill-install
  • 或者手动下载,放到 AI 指定的 skills 目录下

Skill 的进阶:从“小工具”到“应用商店”

Skill 正像手机 App 一样,演变成一种生态。 - 官方商店化: - ChatGPT GPTs:OpenAI 官方商店,用户能创建并分享定制版 ChatGPT,甚至赚取收入。 - 阿里云百炼平台:可定义和发布包含知识库、工作流的商业级 AI 应用。 - Workflow(工作流):更复杂的“Skill 组合”,像工厂流水线。可设定“先由 A 处理,再由 B 审核,最后 C 输出”的流程。DifyLangChain 就是搭这种工作流的常用框架。

AI 的记忆系统

  • 短期记忆:就是上下文窗口,对话结束就清空,临时记事本。
  • 长期记忆:把重要信息持久存储,跨会话记住你的偏好。通常结合向量数据库实现,让 AI 在很多次对话后依然记得你是谁、喜欢什么。

扩展

八、Skill(技能)—— 让 AI 变成“专家”的说明书 章节末尾,现有的“Skill的进阶:从‘小工具’到‘应用商店’”之后,新增以下小节:

Skill 的进阶:工作流(Workflow)

工作流是什么?

如果说 Skill 是“单步操作说明书”,那工作流就是“多步操作流水线”——它把多个 Skill 或 AI 调用按照特定顺序串起来,形成一个完整的自动化流程。

打个比方: - Skill 像一台咖啡机:按一个按钮,出一杯咖啡。 - 工作流 像一条咖啡生产线:先磨豆 → 再萃取 → 然后打奶泡 → 最后装杯。每一步都有专门的工序,顺序不能乱。

Skill vs 工作流 vs Agent(智能体)

很多初学者会混淆这三个概念,用一张表说清楚:

概念 核心特点 适用场景 类比
Skill(技能) 给AI写一份“操作说明书”,告诉它某种特定任务该怎么做 输出格式固定、反复使用的任务,如“周报生成器” 一个菜谱
Workflow(工作流) 把多个步骤串成流水线,按顺序执行,每步的输出是下一步的输入 需要多步处理的复杂任务,如“自动爬数据 → 清洗 → 生成报告” 一条生产线
Agent(智能体) AI自己决策“下一步做什么”,能根据中间结果灵活调整,甚至调用工具 任务不固定、需要自主规划的复杂场景 一个能随机应变的厨师

更直观的区别: - Skill:你把“每一步怎么做”都写好,AI照着执行。 - Workflow:你把“整个流程”设计好,系统自动跑完所有步骤。 - Agent:你只给一个“目标”,AI自己拆解步骤、选工具、调整策略。

工作流的常见应用场景

  1. 内容生产流水线
    • 步骤1:AI搜索最新行业资讯
    • 步骤2:AI根据资讯生成文章初稿
    • 步骤3:AI对文章进行润色和校对
    • 步骤4:AI自动排版并发布到公众号
  2. 数据处理流水线
    • 步骤1:AI读取Excel原始数据
    • 步骤2:AI进行数据清洗和格式转换
    • 步骤3:AI生成数据可视化图表
    • 步骤4:AI自动发送报告邮件给相关人员
  3. 代码开发流水线
    • 步骤1:AI根据需求生成代码
    • 步骤2:AI自动运行单元测试
    • 步骤3:若测试失败,AI自动修复代码
    • 步骤4:AI生成代码审查报告

搭建工作流的常用工具

  • Dify:拖拽式搭建AI工作流,适合非技术人员快速上手
  • LangChain:代码化构建工作流,适合开发者深度定制
  • n8n / Zapier:通用的自动化工作流工具,可集成AI能力
  • Coze(扣子) :字节出品,支持工作流编排和Bot发布

一句话总结:

Skill 是“怎么做好一件事”的说明书,Workflow 是“怎么完成一个项目”的流水线,Agent 是“自己决定怎么完成任务”的智能体。三者从简单到复杂,从“手把手教”到“放手让它干”。

补充关联:在工作流和智能体的运行中,往往还需要记忆系统的支撑——短期记忆(上下文窗口)让AI记住当前对话的来龙去脉,长期记忆(向量数据库)让AI跨会话记住用户的偏好和历史。三者常配合使用,共同构成一个完整的AI应用。

LangChain 是构建 AI 应用(尤其是智能体)的核心框架,可以把它理解为一个 “AI 应用的操作系统”或“乐高积木”


九、学生该练哪些“硬本事”?

AI 越强,下面这几点反而越值钱,我们把它提炼成一个 “五力模型”,这正是 AI 替代不了的核心能力:

  1. 【会用】AI 工具力:知道什么问题找什么 AI,能写明白提示词,让 AI 帮你提速,而不是替你思考。比如让它给你讲懂一道题,比直接抄答案有用一百倍。
  2. 【能判】批判性思维:AI 会犯错,会一本正经地胡说八道。你得有自己的判断,用它给的答案去反查一手资料,不盲信。
  3. 【会想】创造性思维:AI 负责把点子可视化、文本化,你负责追问“为什么?”和“能不能换个角度?”。想出真正的新点子,还是人的事。
  4. 【懂人】同理心与协作力:理解用户的真实需求,感知团队伙伴的情绪,这是人与人协作的根本,AI 无法体会。
  5. 【善学】元学习能力:AI 更新极快,知道自己该怎么学一个新工具、新领域,并快速上手。习惯不断学新东西的人,最不容易被淘汰。

2026 年世界经济论坛《未来就业报告》指出,到 2030 年,AI 将替代约 9200 万个岗位,但同时将创造 1.7 亿个新岗位,净增 7800 万。掌握 AI 协作能力将成为最核心的就业竞争力。


十、一张图记住整个流程

芯片出力气(算力)→ 力气变成 AI 能读的“字”(Token)→ 大模型猜字、组织答案 → 智能体动手帮你干活 → 产出文章/图片/代码 → 一个人+AI 跑通整条路(OPC

打个比方: - 算力是汽油——AI 运转的底层动力 - 大模型是发动机——把汽油转化成动力 - Token是跑过的里程——你用得越多,跑得越远 - 智能体是司机——帮你规划路线、踩油门、打方向盘 - Skill是导航地图——告诉司机走哪条路最靠谱 - OPC是司机自己开公司——一个人+AI,跑出整条产业链


十一、当前大趋势与挑战(了解就行)

趋势

  • 中国算力规模世界第二,“算电协同”首次写入 2026 年政府工作报告。
  • 全国 23 个城市出台“一人公司(OPC)”扶持政策,算力券最高 2000 万元。
  • AI 智能体正从“能干活”(小龙虾)向“会进化”(爱马仕)演进
  • 全球近一半新代码由 AI 生成(46%)。
  • 端侧 AI:模型直接跑在手机/电脑芯片上,不用联网,更快、更省电、更隐私。
  • 科学 AI:AI 正加速科学发现。DeepMind 的 AlphaFold 已预测几乎全部蛋白质结构,用于新药研发。
  • 具身智能:给 AI 大脑配上机器人身体,在物理世界中执行任务,是 AI 的终极形态之一。
  • AI 合成数据:互联网真实数据快不够用了,开始用 AI 生成的数据来训练新 AI。

AI 界的“路线之争”

  • 开源 vs 闭源:以 Meta(Llama 模型)和 DeepSeek 为代表的开源阵营认为开源能加速创新;以 OpenAI 和 Google 为代表的闭源阵营认为闭源更安全、更能保证商业可持续。
  • Scaling Law(规模定律)是否遇到天花板? 过去“算力越大、数据越多,模型越聪明”的规律似乎开始放缓。接下来是继续堆算力(做更大),还是改进算法架构(做更巧),业内分歧极大。
  • 世界模型:让 AI 不仅处理语言和图像,还能理解物理世界的因果规律,具备常识推理能力,被认为是通往 AGI 的关键一步。

资本与市场

  • 2025 年全球 AI 投资总额超 2000 亿美元,其中算力基础设施占比最大。
  • 全球 AI 产业正从“模型军备竞赛”转向“应用生态建设”,投资人更关注“你的 AI 怎么赚钱”。
  • AI 相关岗位薪资溢价明显:国内 AI 工程师平均薪资比同级别传统工程师高 30%–50%。

挑战与争议

  • 能源消耗:大模型训练和运行极其耗电,一个大型数据中心年耗电量堪比小型城市。
  • 数据隐私:你用 AI 时输入的每一句话都可能被用于改进模型。部分厂商提供“对话不用于训练”的选项,但默认设置下,谨慎对待敏感信息是最稳妥的做法。
  • 版权与伦理:AI 用他人作品训练是否侵权?生成的内容归谁?AI 换脸诈骗怎么办?法律还在追。
  • 就业结构冲击:低创意、高重复性的任务容易被取代;人与 AI 协作、解决复杂问题的岗位变得更重要。
  • AI 安全与对齐:如何确保越来越聪明的 AI,其目标和价值观始终与人类一致,是全球顶尖实验室正在攻关的核心难题。

十二、计算机学生就业实战指南(通用版)

这一章是专门写给要走出校门的同学的,不堆术语,只说面试、实习、入职后真正会碰到的东西。开发、运维、测试等方向均可参考。

1. 岗位的“新分类”(所有方向)

AI 时代,计算机学生的就业岗位正在重新洗牌,但不必焦虑——核心是“原来的岗位 + AI 能力”:

岗位方向 原来的定义 现在的新要求
应用开发 写 Java/Python/前端 会调大模型 API、搭 RAG、用 LangChain
算法/研究 训模型、推公式 一样,但更强调工程化部署和轻量化
运维/SRE 管服务器、写脚本、7×24 值班 用 AI 辅助排障、写运维脚本、智能告警分析
测试/QA 手工/自动化测试 用 AI 生成测试用例、自动做回归测试
数据工程 ETL、SQL 会用大模型做数据清洗、打标签、合成训练数据
安全 渗透、防御 用 AI 做威胁分析、异常行为检测、自动响应
产品经理 画原型、写 PRD 懂大模型边界,能设计 AI 产品的交互和评估体系

一句话:所有岗位的 JD 里都开始出现“了解大模型”“有 AI 项目经验”这样的字眼。


2. 各个方向必知必会的技术栈

面试或实习时,你会发现公司做的不是“从零训练模型”,而是“用模型搭应用/保稳定/找 Bug”。各方向最常碰到的框架,知道名字和用途即可:

开发方向

框架 用途 一句话
LangChain 大模型应用开发框架 搭 AI 应用的“脚手架”,串起 LLM、数据库、工具
LlamaIndex 数据索引框架 专注做 RAG,把文档变成可检索的知识库
Dify 低代码 AI 平台 拖拽式搭 AI 工作流,中小公司最爱
FastAPI 高性能 Web 框架 给 AI 模型包一层 API,Python 后端首选
vLLM 推理加速 让大模型跑得更快更省显存,部署必用
Streamlit/Gradio 快速 Demo 几行代码出界面,给老板演示用

运维方向

框架/工具 用途 一句话
Docker/K8s 容器化与编排 大模型部署的标配,GPU 资源调度全靠它
Prometheus + Grafana 监控 监控 GPU 使用率、API 延迟、Token 消耗
Datadog AIOps 智能运维 自动去噪告警、根因分析,减少 MTTR
Ollama 本地模型运行 在本机快速起一个开源模型,测试、学习神器
Ansible/ Terraform 自动化与 IaC AI 帮你写 playbook 和模板,但你要会审
Warp AI 原生终端 用自然语言写命令、解释报错,运维效率翻倍

测试方向

框架/工具 用途 一句话
Selenium + AI 自动化测试 AI 帮你生成测试脚本、自动修复失效的定位器
Playwright + AI 端到端测试 同上,微软出品,更强
Applitools 视觉测试 AI 自动检测界面像素级差异,不用人肉对比

面试常问:不管你面哪个方向,都可能被问到“你怎么用 AI 提效?”“你了解 RAG 吗?”“大模型部署要注意什么?”——不需要精通,但要能用自己的话讲清楚。


3. 各方向面试最可能碰到的实操概念

概念 开发方向怎么答 运维方向怎么答 测试方向怎么答
RAG “先查后答,外挂知识库,减少幻觉” “要维护向量库的稳定,关注检索延迟和数据新鲜度” “AI 先检索文档再生成答案,测试重点在于召回率和答案准确性”
向量数据库 “存文本向量,做语义搜索” “要监控索引构建开销,保障高并发低延迟” “验证相似度阈值对结果的影响,边缘 case 多测”
模型幻觉 “加 RAG、限制温度、明确说不知道” “幻觉会导致错误决策,要在关键链路加人工审核” “构造对抗样本,测试模型在边界问题上的表现”
流式输出 “用 SSE 实现打字机效果,体验好” “反向代理要支持长连接,监控连接数和超时” “测试流中断、网络抖动下的表现”
模型部署 “用 vLLM/TGI,调显存和并发” “做灰度发布、自动扩缩容、GPU 资源池化管理” “验证灰度期间新旧模型的一致性和回滚策略”

4. 项目中常见的坑(和对应的亮点做法)

无论什么方向,面试官都看过太多烂大街的项目。以下是大忌和加分项,通用性极高:

❌ 减分项 ✅ 加分项
“我调了个 API 做了个聊天机器人” “我给学校图书馆做了个 AI 问答,能指定检索范围,答不出时说不知道”
代码无注释、无 README README 有架构图、有快速开始、写了遇到的坑
没考虑成本和滥用 加了缓存策略、速率限制、输入过滤
只做功能,不考虑“挂了怎么办” 做了健康检查、降级方案、重要操作留日志

一个好的学生项目 = 真实痛点 + 技术选型讲得出理由 + 考虑了错误处理 + 文档清晰


5. 进入职场前的“最小行动清单”(不分方向)

大二/大三就能做的事 1. 注册 GitHub,上传至少一个项目(哪怕只是课程设计 AI 版) 2. 学会用 Git(clone、commit、push、pull request 就行) 3. 在笔记本上用 Ollama 跑一次开源模型(部署方向尤其重要) 4. 把 ChatGPT/Claude/DeepSeek 的 API 都调一遍,对比感受 5. 用 LangChain 搭一个带 RAG 的问答系统(开发/测试都适用)

大三暑假实习前 6. 背熟一个自己项目的完整介绍(为什么做、怎么设计、遇到什么坑、效果如何) 7. 准备几个系统设计面试题: - 开发:“怎么设计一个 AI 客服系统?” - 运维:“怎么设计一个能自动扩缩容的模型推理服务?” - 测试:“怎么测试一个 AI 问答系统的质量?” 8. 在 LeetCode 刷 100 道高频题(所有技术岗都考算法) 9. 注册一个技术博客账号(知乎/掘金/CSDN),尝试写一篇 AI 学习笔记——面试官如果能搜到,会非常加分


6. AI 应用的经典架构图(开发和运维通用)

这张图建议记在脑子里,面试时画给面试官看,能讲清每个模块的作用,你就超过 80% 的竞争者:

用户端 (Web/App)
       │
       ▼
  API 网关 (鉴权、限流、路由)
       │
       ├──────▶ 应用层 (LangChain / 自研逻辑)
       │              │
       │              ├──▶ 大模型 API (GPT/DeepSeek 等)
       │              │
       │              ├──▶ 向量数据库 (Milvus/Weaviate)
       │              │
       │              └──▶ 缓存层 (Redis)
       │
       └──────▶ 监控 & 日志 (Prometheus + Grafana + ELK)
                     │
                     └──▶ 告警 & 值班 (PagerDuty/飞书通知)

开发岗能讲应用层和模型调用,运维岗能讲网关、监控和部署,测试岗能讲在这个链路上怎么埋测试点。各方向都说得出东西。


最后的建议(给每一位同学): 面试官不指望应届生精通所有东西,但他们希望看到: - 你会主动学(有项目、有博客、有好奇心) - 你能把复杂问题讲清楚(图 + 人话 + 代码/配置示例) - 你知道企业不是做研究,而是做产品/保服务(成本、稳定性、可观测性)

把这份指南看完,挑一个你最感兴趣的方向,真正动手做一个小项目,你就能自信地走进任何一家科技公司的面试间。

学生常见的十大疑问(及解答)

疑问 解答
AI会取代我的工作吗? 会改变工作方式,但创造新岗位;学会用AI的人比不会用的更有竞争力
AI有情感吗? 没有,它只是模仿语言模式,不理解“喜怒哀乐”
AI为什么有时胡说八道? 因为它基于概率,不是真理;而且训练数据可能带有错误或偏见
我用AI写作业算作弊吗? 如果直接用AI生成而不思考,算抄袭;如果用来辅助理解、理清思路,是合理工具
大模型会记住我的隐私吗? 一般不主动记录,但你的对话可能被用于改进模型(谨慎输入敏感信息)
AI能画图,那设计师会失业吗? 初级设计可能被替代,但创意和审美仍是人类优势
为什么国内AI和国外有差距? 数据、算力、开源生态等方面有差异,但差距在缩小
我要学编程吗? 学编程能帮你更好理解AI原理,但未来“自然语言编程”会降低门槛,逻辑思维更重要
AI能自我进化吗? 目前不会,它靠人类改进;但像Hermes这类能记忆和优化任务流程,算“有限进化”
我该怎么开始学AI? 从“用”开始——注册一个ChatGPT或DeepSeek,每天问10个问题,两周后你就会有感觉