AI 入门看了很多,为什么还是不懂?从 Prompt、AI 工具到大模型原理一次讲清楚
AI 入门看了很多,为什么还是不懂?从 Prompt、AI 工具到大模型原理一次讲清楚
最近看了一些 AI 入门教程,内容通常包括:

- 什么是人工智能
- Prompt 提示词怎么写
- 常见 AI 工具有哪些
- ChatGPT 这类大模型如何工作
每一个概念单独看,好像都能理解。
但把它们放在一起时,还是容易产生一种感觉:
例如:
- AI、机器学习、大模型之间有什么区别?
- Prompt 真的是几个“关键词”吗?
- ChatGPT、Cursor、Midjourney、Agent、MCP 分别属于哪一层?
- 大模型到底是在思考,还是在猜答案?
- 为什么同一句话问两次,得到的结果可能不同?
- 为什么 AI 有时候回答得很自信,内容却是错的?
这篇文章不准备堆积太多专业名词,而是尝试从一个普通开发者的角度,把 AI 的整体结构串起来。
一、先建立一张 AI 的整体地图
理解 AI,可以先把它分成三个层次:
底层:AI 模型中间层:AI 工具上层:AI 工作流
这三层分别解决不同的问题。
1. AI 模型:提供基础能力
AI 模型相当于一台“智能发动机”。
它能够完成:
- 理解文字
- 生成文字
- 分析图片
- 编写代码
- 总结资料
- 翻译内容
- 推理问题
常见的大语言模型包括 GPT、Claude、Gemini、Qwen、DeepSeek 等。
模型本身通常只负责接收输入并生成输出。
可以把它理解成一个函数:
输出结果 = 模型(输入内容)
例如:
输入:请解释什么是闭包输出:闭包是一个函数以及它所引用的外部变量环境的组合……
但是,单独拥有模型,并不代表它就能自动读取你的项目、修改代码、搜索网络或者操作电脑。
这些能力通常由上层工具提供。
2. AI 工具:给模型装上操作界面
ChatGPT、Cursor、Copilot 等产品,本质上不是一个单纯的模型。
它们通常由几部分组成:
AI 工具 = 模型 + 用户界面 + 文件能力 + 搜索能力 + 工具调用能力
例如,在一个 AI 编程工具中,模型可能获得以下能力:
- 读取项目目录
- 搜索代码
- 修改文件
- 执行命令
- 查看编译错误
- 根据错误继续修改
模型还是那个模型,但工具让它可以参与真实工作。
这就像发动机本身只能产生动力,汽车还需要方向盘、轮胎、刹车、导航和车身结构。
所以我们不能简单地说:
更准确的说法是:
3. AI 工作流:让多个步骤自动协作
当 AI 不再只是回答一个问题,而是连续完成多个步骤时,就形成了 AI 工作流。
例如,我们让 AI 完成下面的任务:
读取需求文档→ 分析项目结构→ 编写代码→ 执行编译→ 分析错误→ 修改代码→ 生成测试报告
这已经不是简单的“一问一答”,而是一套任务流程。
如果 AI 能够自己判断下一步做什么、选择工具并根据结果继续行动,通常就会被称为 Agent,也就是智能体。
因此可以简单记住:
模型负责思考和生成工具负责提供操作能力工作流负责组织执行步骤Agent 负责在工作流中自主决策
二、AI、机器学习、深度学习和大模型有什么区别
这些词经常一起出现,但它们不是同一个概念。
可以把它们理解成从大到小的包含关系:
人工智能 AI└── 机器学习 Machine Learning└── 深度学习 Deep Learning└── 大语言模型 Large Language Model
1. 人工智能
人工智能是一个很大的概念。
只要机器表现出了某种类似人类智能的能力,都可以被归入 AI,例如:
- 语音识别
- 人脸识别
- 推荐系统
- 自动驾驶
- 下棋程序
- 文本生成
2. 机器学习
传统程序一般由开发者直接编写规则:
如果温度大于 30 度,就显示“天气炎热”
而机器学习不是把所有规则都写死,而是给机器大量数据,让它从数据中学习规律。
例如,我们给系统很多垃圾邮件和正常邮件,它会逐渐学习哪些词、结构和发送方式更像垃圾邮件。
3. 深度学习
深度学习是机器学习的一种方法,核心是使用多层神经网络处理复杂数据。
它特别适合处理:
- 图像
- 语音
- 自然语言
- 视频
- 多模态信息
目前我们常见的大模型,大多数都建立在深度学习基础之上。
4. 大语言模型
大语言模型主要学习人类语言中的规律。
它不是把互联网内容原封不动地保存起来,而是通过训练,学习大量文字之间的关系,例如:
- 哪些词经常一起出现
- 一句话通常如何继续
- 一个问题通常对应什么回答结构
- 一段代码应该遵循什么语法
- 一篇文章如何组织标题、段落和论点
所以,大语言模型可以生成看起来非常自然的文字。
三、大模型到底是怎么“说话”的
很多人第一次使用 ChatGPT 时,会感觉它真的理解了自己。
但从底层原理看,大模型最核心的任务,可以概括为一句话:
1. Token 不完全等于一个字
模型不会直接按我们理解的“字”或者“单词”处理文本,而是先把文本拆成 Token。
Token 可以是:
- 一个汉字
- 一个词的一部分
- 一个英文单词
- 一个标点符号
- 一段常见字符
例如:
我喜欢学习人工智能
可能会被拆分成若干 Token,然后转换成数字交给模型处理。
2. 模型不断预测下一个 Token
假设输入是:
中国的首都是
模型会计算后面最可能出现的内容。
“北京”的概率通常最高,所以它会生成“北京”。
生成一个 Token 后,模型会把它加入上下文,再继续预测后面的 Token。
中国的首都是 → 北京 → , → 它 → 位于……
一段完整回答,本质上就是这样一步一步生成出来的。
3. 为什么它看起来像在思考
因为模型学习过大量语言中的表达结构、知识关系和推理模式。
当你问一个问题时,它会根据这些模式生成一条看起来合理的回答路径。
在复杂任务中,模型确实可以进行多步骤推理,但它的推理方式并不完全等同于人类意识。
更稳妥的理解是:
四、为什么 AI 会一本正经地回答错误内容
这种现象通常被称为“幻觉”。
模型的首要目标是生成语言上合理的后续内容,而不是自动保证每句话都经过事实核验。
例如你问:
请介绍一个并不存在的开源框架。
如果问题的写法让模型误以为这个框架真实存在,它可能根据常见技术文章结构生成:
- 项目背景
- 核心功能
- 安装方式
- 使用示例
这些内容读起来很完整,但可能全部是编造的。
这不是因为模型故意欺骗,而是因为它在执行“生成最合理文本”的任务。
因此,在以下场景中不能只依赖模型记忆:
- 最新新闻
- 法律政策
- 医疗建议
- 软件最新版本
- API 最新文档
- 具体数据和引用
- 项目中真实存在的文件和方法
更可靠的方法是让 AI 结合外部资料:
模型能力 + 搜索结果 + 官方文档 + 项目文件
这也是为什么现在很多 AI 产品会提供联网搜索、文件读取和知识库功能。
五、Prompt 到底是什么
Prompt 通常被翻译为“提示词”。
很多教程会告诉你,要使用角色、目标、背景、格式、限制条件等关键词。
这些方法没有错,但容易让初学者误以为:
实际上,Prompt 的本质是:
它更像给同事写任务说明,而不是念一段咒语。
1. 一个模糊的 Prompt
帮我写一个登录页面。
这个请求缺少很多信息:
- 使用什么技术?
- 页面运行在哪里?
- 是否需要接口?
- 是否需要表单校验?
- 输出完整项目还是单个文件?
- 页面是什么风格?
AI 只能自行猜测,因此结果容易与预期不同。
2. 一个更清晰的 Prompt
使用 HTML、CSS 和原生 JavaScript 编写一个登录页面。要求:1. 包含手机号和密码输入框;2. 点击登录前校验不能为空;3. 不调用真实接口,使用 Promise 模拟请求;4. 登录成功后显示提示信息;5. 分别输出 index.html、style.css 和 main.js;6. 代码中添加必要注释。
它并没有使用多么神秘的关键词,只是把需求交代得更清楚。
3. 一个实用的 Prompt 结构
可以使用下面这个结构:
角色:你希望 AI 以什么身份处理任务背景:当前项目和问题是什么任务:具体需要完成什么约束:不能做什么,必须遵守什么输出:最终结果采用什么格式验收:怎样才算完成
例如:
你是一名 HarmonyOS ArkTS 开发工程师。背景:项目通过 ArkWeb 加载 rawfile 中的本地 H5 页面,当前需要验证 H5 调用 ArkTS 的最小通信链路。任务:实现一个 JavaScriptProxy 示例,H5 点击按钮后向 ArkTS 发送 JSON 字符串,ArkTS 解析后打印日志,再通过 runJavaScript 回调 H5。约束:- 不引入第三方库;- 不实现完整 Dispatcher;- 只验证最小通信闭环;- 使用 ArkTS 可通过类型检查的写法。输出:- Index.ets;- index.html;- myascf.js;- 文件目录说明;- 关键调用链说明。验收标准:点击 H5 按钮后,ArkTS 能收到请求,H5 能收到响应。
这类 Prompt 对编程任务会明显更有效。
六、Prompt 不是越长越好
Prompt 的目标不是“写得长”,而是“减少歧义”。
一段很长但没有关键信息的 Prompt,依然可能得到很差的结果。
真正重要的是:
- 任务是否明确
- 背景是否足够
- 约束是否具体
- 输出是否可检查
例如:
帮我优化代码,要高级一点,专业一点,完整一点。
这句话看起来有很多要求,但“高级”“专业”“完整”都很模糊。
可以改成:
重构下面的 ArkTS 代码,要求:1. 消除重复逻辑;2. 补充明确的参数和返回值类型;3. 不使用 any;4. 保持现有功能不变;5. 列出每一项修改的原因。
修改后的要求更容易执行,也更容易验收。
七、为什么同一个 Prompt 会得到不同答案
大模型生成内容时,通常不会永远只选择概率最高的那一个 Token。
为了让回答更自然、更有创造性,系统可能会从多个高概率候选中进行选择。
因此,同一个问题多问几次,结果可能不同。
影响结果的因素包括:
- 当前上下文
- 模型版本
- 系统提示词
- 温度等生成参数
- 是否开启搜索和工具
- 输入内容的细微差异
这也是为什么重要任务不能只依赖“一次生成”。
更合理的使用方式是:
第一次:让 AI 给出方案第二次:让 AI 自查问题第三次:结合真实环境验证第四次:根据报错继续修正
AI 更适合参与迭代,而不是被当作一次性答案机器。
八、AI 工具全景到底应该怎么看
市面上的 AI 工具很多,但不需要逐个背名称,可以按照任务类型分类。
1. 对话与知识类
主要用于:
- 问答
- 总结
- 翻译
- 写作
- 学习
- 分析资料
典型形态是 ChatGPT 这类聊天产品。
2. 编程类
主要用于:
- 代码补全
- 项目问答
- 修改文件
- 排查错误
- 生成测试
- 执行命令
典型形态包括 IDE 插件、AI 编辑器和命令行编程 Agent。
3. 图像类
主要用于:
- 文生图
- 图片编辑
- 海报设计
- 产品效果图
- 风格转换
这类工具背后通常是图像生成模型或多模态模型。
4. 音频和视频类
主要用于:
- 语音识别
- 文本转语音
- 数字人
- 视频生成
- 自动剪辑
- 字幕制作
5. 办公与自动化类
主要用于:
- 邮件总结
- 会议纪要
- 表格分析
- PPT 生成
- 文档整理
- 跨系统自动执行任务
与其记住几百个工具,不如先问自己:
确认任务类型后,再选择工具会简单很多。
九、Chat、Agent、Skill、MCP 和 API 分别是什么
这些词是 AI 应用中最容易混淆的部分。
1. Chat:对话入口
Chat 是人与模型交互的一种形式。
你输入问题,模型返回答案,适合处理即时任务。
用户 → 对话界面 → 模型 → 回答
2. Agent:能连续执行任务的智能体
普通聊天通常是“一问一答”。
Agent 更强调:
- 理解目标
- 拆分步骤
- 选择工具
- 执行操作
- 检查结果
- 根据结果继续行动
例如,让一个编程 Agent 修复项目时,它可能会:
读取报错→ 搜索相关文件→ 定位代码→ 修改代码→ 重新编译→ 根据新错误继续调整
3. Skill:可复用的任务规范
Skill 可以理解为写给 AI 的“标准作业说明书”。
例如一个文档格式化 Skill,可以规定:
- 标题层级怎么使用
- 中英文之间是否留空格
- 表格采用什么格式
- 代码块如何标注语言
- 哪些内容不能改动
- 输出前需要检查什么
普通 Prompt 通常只服务于当前一次任务,而 Skill 更强调长期复用和统一标准。
可以简单理解为:
Prompt:这一次怎么做Skill:以后遇到这类任务统一怎么做
4. MCP:连接外部工具的通用协议
模型本身不能直接访问所有软件和数据。
如果要让 AI 读取数据库、操作 GitHub、访问内部文档或调用其他系统,就需要把这些能力提供给模型。
MCP 可以理解为一种标准连接方式。
它试图解决的问题是:
不同 AI 应用,如何用统一方式连接不同工具和数据源?
可以类比为 USB 接口。
以前每种设备都使用不同接口,连接成本很高;有了统一接口后,不同设备可以按同一种规范接入。
MCP 不负责让模型变聪明,它负责让模型能够连接外部世界。
5. API:程序之间的调用接口
API 是软件系统之间进行通信的接口。
例如你的程序可以通过大模型 API 发送一段文字并获得模型返回结果。
你的应用 → 大模型 API → 模型 → 返回结果
如果你准备把 AI 能力集成到自己的产品中,通常就需要使用 API。
十、AI 为什么需要上下文
大模型每次回答时,都会根据当前能够看到的上下文生成结果。
上下文可能包括:
- 你刚刚发送的问题
- 前面的聊天记录
- 系统给模型的规则
- 上传的文档
- 搜索到的网页
- 工具执行结果
- 项目中的代码
上下文越准确,回答通常越贴近真实需求。
但上下文不是无限的。
模型有一个“上下文窗口”,表示一次最多可以处理多少 Token。
当内容太多时,可能发生:
- 早期信息被忽略
- 重点不突出
- 回答偏离任务
- 项目细节混淆
因此,给 AI 提供资料时,不是越多越好,而是要尽量保证:
- 内容相关
- 信息准确
- 重点明确
- 文件结构清晰
十一、AI 是怎么训练出来的
从宏观角度看,大语言模型的形成通常会经历几个阶段。
1. 预训练
模型阅读大量文本,通过“预测下一个 Token”学习语言规律。
例如输入:
今天天气很好,我们一起去
模型需要预测后面可能是“公园”“散步”“爬山”等内容。
经过大量训练后,模型逐渐学会:
- 语言结构
- 常见知识
- 表达方式
- 代码模式
- 一定程度的推理规律
2. 指令微调
只有预训练的模型,更像一个自动续写器。
为了让它学会回答问题、执行要求,需要使用大量“指令—回答”数据继续训练。
例如:
指令:把下面内容翻译成英文回答:……
经过这个阶段,模型更懂得如何服从用户指令。
3. 对齐训练
模型还需要进一步学习:
- 什么回答更有帮助
- 什么内容不应该生成
- 如何减少冒犯和危险内容
- 如何按照人类偏好组织答案
这个过程通常会结合人工反馈或自动评估。
4. 推理和工具能力增强
现代模型还会针对数学、代码、复杂推理和工具使用进行专门训练。
所以现在的模型不仅会写文章,还能:
- 分析程序错误
- 调用搜索工具
- 阅读文件
- 执行代码
- 操作外部系统
十二、普通开发者应该如何真正学会使用 AI
只看概念很容易产生“好像懂了”的感觉。
真正理解 AI,最好从实际任务开始。
第一阶段:学会描述任务
先不要追求复杂 Prompt 模板。
每次提问时,至少说清楚:
我要做什么当前是什么情况有哪些限制最终要什么结果
第二阶段:学会让 AI 分步骤工作
不要一次让 AI 完成一个特别大的项目。
例如,不要直接说:
帮我写一个完整的小程序运行时框架。
可以拆成:
第一步:设计目录结构第二步:实现 Web 容器第三步:验证 H5 到 ArkTS 通信第四步:增加请求 ID 和 Promise 回调第五步:抽离 Runtime第六步:增加 API 注册机制
拆分后更容易理解,也更容易验证。
第三阶段:学会验证结果
AI 生成代码后,要检查:
- 是否可以编译
- API 是否真实存在
- 类型是否正确
- 是否符合当前版本
- 是否遗漏异常处理
- 是否改变了原有功能
AI 可以帮助写代码,但真实编译器和运行环境才是最终标准。
第四阶段:形成自己的 Skill
当你反复做同一类任务时,可以把要求沉淀成 Skill。
例如:
- 文档格式化 Skill
- ArkTS 代码检查 Skill
- API 测试用例生成 Skill
- 博客写作 Skill
- Git 提交信息生成 Skill
这样就不需要每次从头解释规则。
第五阶段:尝试自动化工作流
当单个任务使用稳定后,再考虑把多个步骤连接起来。
例如:
读取需求→ 生成代码→ 编译验证→ 修复错误→ 生成测试记录→ 更新文档
这时你就开始从“使用聊天机器人”,进入“设计 AI 工作流”的阶段。
十三、一个开发者实际使用 AI 的例子
假设我们要测试一个 HarmonyOS Web 容器中的通信接口。
传统做法可能是:
- 阅读接口文档;
- 手动创建测试页面;
- 编写调用代码;
- 运行项目;
- 收集错误日志;
- 修改测试代码;
- 整理测试记录。
使用 AI 后,可以把部分工作交给模型:
输入接口文档和项目结构→ AI 生成最小测试页面→ AI 根据日志分析可能原因→ AI 修改调用参数→ AI 生成测试记录表
但是这里有一个非常重要的边界:
因为模型不知道:
- 你的远程机是否连接成功
- 当前安装的是哪个框架版本
- 某个接口在真实运行时是否暴露
- 权限配置是否正确
- 编译器实际返回了什么错误
所以比较合理的协作方式是:
人负责目标、判断和验证AI 负责整理、生成和辅助分析工具负责执行和提供真实结果
十四、使用 AI 时最常见的几个误区
误区一:把 AI 当搜索引擎
搜索引擎通常返回已有网页,大模型则会重新组织和生成内容。
如果需要最新、准确、可引用的信息,应该让 AI 搜索并查看来源,而不是只依赖模型记忆。
误区二:认为 Prompt 有万能公式
不存在一个 Prompt 模板可以解决所有问题。
不同任务需要不同信息。
写文章关注受众和结构,写代码关注技术栈和验收标准,排查错误关注日志和环境。
误区三:认为 AI 输出就等于正确答案
AI 输出首先是一个候选方案。
代码需要编译,数据需要核对,文档需要确认,结论需要验证。
误区四:一次让 AI 做完整项目
任务越大,模型越容易遗漏细节。
拆分任务、逐步验证,通常比一次生成全部内容更可靠。
误区五:只学工具,不理解任务
工具更新非常快。
今天流行某个编辑器,明天可能出现新的产品。
真正长期有效的能力是:
- 准确描述问题
- 拆分复杂任务
- 提供有效上下文
- 验证输出结果
- 设计可复用流程
十五、最后总结:理解 AI,只需要先抓住五件事
第一,大模型是能力核心
它通过学习大量数据中的规律,根据上下文生成结果。
第二,Prompt 是任务说明书
重点不是堆关键词,而是减少歧义,让目标、背景、约束和结果足够清楚。
第三,AI 工具是模型的外壳
工具给模型提供文件、搜索、代码执行和系统操作能力。
第四,Agent 是能够连续行动的 AI
它可以拆解任务、选择工具、执行操作并根据结果继续处理。
第五,AI 输出必须经过验证
模型擅长生成合理答案,但“合理”不一定等于“真实”和“正确”。
可以用一句话概括整个 AI 应用体系:
模型负责生成,Prompt 负责表达,工具负责执行,工作流负责组织,人负责判断。
当我们理解了这几个层次,就不会再被各种新名词绕晕。
以后再看到 Agent、Skill、MCP、RAG 或 AI 工作流时,可以先问:
只要能回答这个问题,大部分 AI 概念就能找到自己的位置。
结语
AI 入门真正困难的地方,不是某个概念特别复杂,而是各种概念经常混在一起出现。
初学者不需要一开始就研究复杂数学公式,也不需要记住所有工具。
先从自己的真实工作开始:
- 用 AI 解释一段代码;
- 用 AI 整理一次报错;
- 用 AI 拆分一个需求;
- 用 AI 生成一个最小 Demo;
- 再通过编译和运行验证结果。
当你完成几次真实闭环后,会发现自己不只是“会问 AI”,而是在逐渐学会:
-
07.21
月亮影视大全app如何下载电视剧
-
07.21
炉石兆示萨卡组3月2026一览
-
07.21
炉石打脸法卡组3月2026详情
-
07.21
金铲铲之战16.7b版本更新全部内容详情
-
07.21
江南百景图同乡会馆建造位置介绍
-
07.21
原神冬极白星属性及突破材料介绍
-
- Kimi K3发布后:最慌的不是英伟达
- 07.21
-
- 90后清华天才:干崩了美股
- 07.21
-
-
- 面试手记:高级 AI 工程师备战与思考
- 07.21
-
- 第3章 记忆系统:构建Agent的长短期记忆
- 07.21
-
- 技术赋能 业界构建AI运动健康新场景
- 07.21
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏