普通人AI入门:10个词看懂AI,从AIGC到Agent。

怎么微调 AI?

停!谁跟你说的?

微调不是普通人能做的事,也不是你想的“投喂几篇资料”就叫微调。你上传文件、写自定义指令、建知识库,通常只是提示词、上下文或 RAG,离微调还差得远。

所以,学好 AI,我们有必要先了解一些 AI 相关的基础概念。

这篇文章不教你造 AI,也不堆术语。它只做一件事:帮你补齐普通人最该懂的 AI 基础概念,从 AIGC、Token 到 LLM、RAG、微调、Agent,搭起一张属于你的 AI 认知地图。地图有了,路就不会越走越乱。

普通人AI入门:10个词看懂AI,从AIGC到Agent。

AIGC

AIGC(Artificial Intelligence Generated Content), 就是人工智能生成内容,包括文字、图片、音频、视频、代码等各类内容。

以前你请写手、画师、剪辑师;现在你可以先让 AI 出初稿,自己再做导演。

它把“内容生产”从纯手工变成了人机协作,普通人也能快速做文案、配图、PPT、短视频脚本。

AIGC 生成的不等于真实,也不等于没有版权风险。它可能编、可能抄、也可能偏。所以事实要核查,版权要留意,重要内容必须人工把关。

这里稍微提一下,可能我们也会经常听到AGI这个词。AGI(Artificial General Intelligence):通用人工智能,具备和人类相当、能理解、学习、完成任意智力任务的人工智能,不局限单一领域。

  • AIGC:专注生成内容的 AI(当前我们在用的这类)

  • AGI:拥有通用思考能力的 AI,目前还属于理论目标,尚未实现。

LLM

LLM(Large Language Model)是指大语言模型,基于海量文本数据训练的大型模型,擅长理解和生成人类语言,是现在 AIGC 里文本类产品的核心底座(技术底座),比如各类对话 AI 就依托 LLM。

你可以把它理解成 AI 工具(产品)背后的“大脑”。ChatGPT、Claude、Kimi、豆包AI、通义千问、DeepSeek 这些工具用起来不一样,首先就是因为它们背后的“大脑”不一样。AI 工具出厂设置不同,有的文科强,有的理科强,有的代码厉害,有的多模态强,有的特别会聊天,有的记性好,有的爱编故事。

通俗说,LLM 是一个“读过海量文字、特别会接话”的模型。你问它问题,它根据前面的内容,预测接下来最可能出现的词,跟“文字接龙”游戏很像是不是。

它并不像人一样真正理解世界,而是通过大量训练,学会了语言规律、知识模式和回答套路。

我们可能会对大模型有个误解,它不是数据库,也不是搜索引擎;它不知道的事,可能会编一个答案给你。所以我们可以把它当“语言能力很强的助手”,别当“永远正确的权威”。

Token

Token 是模型处理文本的最小单位,也是计费、速度和上下文长度的计算单位。

就像乐高积木,你给 AI 的句子,会被拆成一块块小积木。

API 按 Token 收费,上下文窗口按 Token 限制,生成速度也跟 Token 有关。

Token 不等于字数。中文里,1 个汉字大约 1—2 个 Token,具体要看模型。

在使用AI时,长文、长对话、大量资料,都会消耗更多 Token,也会更贵、更慢。

如果用一句话总结,那就是:Token 不是字,但决定了 AI 的“饭量”和“账单”。

上下文窗口

上下文窗口是模型一次能记住并处理的 Token 数量。

我们可以把它理解为一张工作台,台面越大,你能同时摊开的资料就越多。如果台面满了,旧资料就会被挤掉。

上下文窗口决定了 AI 能读多长的文章、记住多长的对话、处理多复杂的任务。

但是窗口大不等于一定记得住。中间内容可能被忽略,长对话也可能“忘事”。上下文窗口是 AI 的短期记忆,不是无限硬盘。

所以我们在使用AI时注意:长对话要阶段性总结;重要资料最好分段喂,或者用 RAG 外挂知识库。

提示词/Prompt/指令

这3个词是一样的意思。

提示词就是你输入给 AI 的指令,相当于你给 AI 的“派活说明书”,决定它怎么理解任务、输出什么。

你说得越清楚,他越不容易跑偏。

同一个模型,提示词不同,输出质量可能差很多。

好提示词通常包含:角色、任务、背景、要求、输出格式、示例等。

提示词就是你的管理能力。

多模态

多模态指模型能处理文本、图片、音频、视频等多种信息形式。

以前的 AI 只会读字,现在它还能看图、听声音、甚至生成视频、音乐。它让 AI 能用在识图、OCR、语音助手、视频分析、AI 绘画等场景。

不是所有模型都真多模态。有些只是“文本模型 + 外挂工具”,比如很多 PDF 问答、扫描件识别、截图总结工具。

举个例子,OCR + 文本 LLM —— “看图识字”不等于“看图理解”。你上传一张发票、合同截图或 PDF,问 AI:“这张图里写了什么?”

背后可能是:

  1.    先用 OCR 工具把图里的文字抠出来;
  2.    再把文字粘给纯文本 LLM;
  3.    LLM 总结、回答。
如果图里有文字,它答得不错。

但如果你问:“左上角那个蓝色 logo 是什么?”“表格第三行和第五行有什么视觉关系?”“印章盖在哪里?”它可能就懵了。

因为 LLM 从头到尾看到的只是一段文字,不是图片。

那么,像GPT-4o、Gemini、Claude 3、Qwen-VL、LLaVA 这类视觉语言模型,能直接处理图像输入,能回答图像细节、位置、颜色、图表趋势,就是真多模态。

幻觉

幻觉是 AI 生成看似合理、其实错误或虚构的内容,不懂装懂!

虽然不懂装懂吧,还说得特别自信?

它会编参考文献、编法条、编数据、编新闻,而且语气很像真的。

模型越强,幻觉不一定完全消失,只是可能更少、更隐蔽。

所以我们使用时要注意:法律、医疗、金融、新闻、学术内容,必须交叉验证。让它给来源,也要自己点开看。现实世界里,背锅的人可是我们哦~

微调

微调是用特定领域或风格的数据,继续训练已有模型,让它更符合你的需求。

像新员工入职后的岗前培训、专业培训,让它更懂你们公司的业务和说话方式。

它能让模型更懂垂直领域、固定风格、特定格式。

经常有朋友问贝拉“怎么微调大模型?”这个问题,打住!普通人日常用 AI 工具,基本不会直接用到微调。微调可不是“喂几篇文档”那么简单的,也不是所有问题都靠微调解决。

你用的 ChatGPT、Kimi、豆包、通义,背后可能已经被厂商微调过,但你本人只是在“用成品”,不是在“做微调”。

普通人优先用提示词 + RAG;而微调成本更高,需要数据、算力和评估。

Agent

Agent 是会自己干活的“数字员工”,是能规划步骤、调用工具、执行任务的 AI 系统。

它就真的像数字员工啦。你给它目标,它自己查资料、写邮件、做表格、跑流程。它把 AI 从“问答工具”升级成“任务执行者”,是自动化工作流的方向。

像现在比较火爆的小龙虾、workbuddy、codex、千问办公等都是Agent。

Agent 不是全自动赚钱机器,也不是完全可靠。它可能出错、绕路、乱调工具。

权限要最小化,关键步骤要人工确认,涉及付款、删库、发邮件、发私聊消息等时更要谨慎。

Agent 很能干,但缰绳要握在人手里。

以上就是部分 AI 基础概念。它们不是孤立的术语,而是地图上的一个个坐标。知道每个坐标在哪儿,你才能判断一个新工具背后用的是什么、能干什么,以及我们如何用好 AI。

 

分享到: 文章二维码
© 版权声明

暂无评论

您必须登录才能参与评论!
暂无评论...