01先分清:提取、转写、总结和蒸馏不是一回事
很多人拿到一份资料后,第一句话就是:
帮我总结一下。
AI 很快会给出一份重点摘要。读的时候感觉什么都有,真正遇到业务问题时,却还是不知道该怎么判断。
因为下面几件事看起来相似,实际得到的东西完全不同:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
比如一段直通车课程说:“点击率低时,要先优化创意。”
普通摘要记下这句话就结束了。
真正的蒸馏还会继续追问:
- 什么情况下才算点击率低?
- 应该和行业、竞品,还是自己的历史数据比较?
- 问题来自主图、关键词、人群,还是展示位置?
- 修改后观察多久、积累多少样本再判断?
- 能不能同时修改图片、出价和人群?
- 哪些类目和场景不能直接套用?
- 这条结论来自哪一页课程、哪一段视频或哪份官方规则?
这些条件保留下来,AI 学到的才不是一句结论,而是一套判断方式。
摘要压缩的是篇幅,蒸馏保留的是判断能力。
02蒸馏前,先决定以后要让它做什么
同一份课程,可以被整理成完全不同的东西。
如果只是想快速读完,生成摘要和思维导图就够了。
如果以后要频繁查找,就应该做成带页码、时间戳和来源的知识库。
如果希望 AI 面对新问题时给出判断,就必须继续提取触发条件、所需数据、判断标准、推荐动作和禁用条件。
如果还希望 AI 读取报表、计算指标并输出方案,最终就要把知识和执行流程结合成 Skill。
我通常把蒸馏结果分成四层:
- 能找到:知道规则、案例和原文在哪里;
- 能理解:能区分事实、作者观点、案例和推断;
- 能判断:面对新场景,知道应该调用哪条方法;
- 能执行:能生成 SOP、检查表、诊断结果或报告。
很多蒸馏项目最后生成了一大堆文件,却不好用,不一定是 AI 能力不够,而是最开始只说了“帮我整理”,没有说明以后希望它替自己完成什么任务。
03PDF 课程:不要按原目录压缩,要按业务问题重组
我拿一套爆品运营课程做过测试。
这类 PDF 有一个常见问题:看上去是文档,实际上每一页都是扫描图片。普通工具可能抽取不到正文,也可能把表格顺序读乱。
所以第一步不是直接处理整本,而是先抽取前、中、后几页测试:
- 有没有文本层;
- 表格会不会错列;
- 图片里的文字能不能识别;
- 手写批注会不会遗漏;
- 页码和章节能不能保留。
确认读取路线后,再进入正式处理:
这里最容易犯的错误,是按照原书目录逐章压缩。
人可以从第一章读到最后一章,但 AI 工作时面对的是一个具体问题。因此,最终的知识结构应该围绕业务任务重新组织,例如:
- 如何判断一个商品值不值得测试;
- 新品应该先测图还是先测款;
- 测试阶段应该观察哪些过程指标;
- 什么情况下继续、暂停或补数据;
- 如何判断高投产是不是带来了真实增量;
- 如何复盘一次推广测试。
每个主题至少保留六部分:什么时候使用、需要什么输入、判断规则、操作步骤、案例与反例、原始证据。
04视频课程:转成文字只是开始
视频比 PDF 多一层难度。
它的知识同时存在于声音、字幕、屏幕操作和前后语境里。只把声音变成文字,很容易丢掉操作界面、时间顺序和讲师当时的限定条件。
我之前处理直通车视频时,最后整理出了资料索引、学习地图、术语字典、逐条学习卡、核心知识、操作 SOP、避坑清单、实操题、检查表、HTML 知识库,以及一套完整的淘宝单品起款与投放手册。
当时的第一步,是先把下载到本地的视频交给 faster-whisper,用中文模型批量生成带时间戳的逐字稿。
每条视频不只保存一份文字,还同步保留三类结果:方便阅读的 Markdown 逐字稿、记录每句话开始与结束时间的分段数据,以及模型、语言、视频时长和处理状态等元数据。
这样做的好处是,后面发现某个术语识别错误,或者某条运营建议缺少上下文时,可以沿着视频编号和时间戳回到原视频核验,而不是在一堆失去来源的文字里猜。
整体流程是:
视频蒸馏有几个字段不能省略:
- 视频名称、讲师和课程版本;
- 原视频编号和关键内容时间戳;
- 操作画面截图;
- 讲师观点和平台事实的区分;
- 数字阈值的适用范围;
- 需要回听、重转或人工确认的内容。
语音识别很容易把平台名、指标名和行业术语转错。如果不保留原视频和时间戳,后面发现一句话不合理时,就很难回到证据重新确认。
视频蒸馏不是把声音变成文字,而是把散落在不同视频里的经验,重新拼成一套完整的方法。
为了方便大家复现,我把这套流程整理成了一个脱敏版“电商视频知识蒸馏工具包”。里面包含批量转写脚本、素材索引脚本、环境安装说明、蒸馏提示词和一个可继续修改的 Skill。
05内容不同,蒸馏方式也不同
PDF 和视频只是两种常见资料。电商人的知识来源很多,每一种资料的价值和风险都不同。
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
这里尤其要区分“课程知识”和“平台事实”。
讲师说某个指标达到多少可以放量,可能只是某个类目、某个客单价和某段时间里的经验;平台官方说明某个功能如何归因,则属于需要保留版本和发布日期的事实。
两者都可以使用,但不能混成一句没有来源、没有条件的标准答案。
06怎么证明蒸馏结果不是 AI 编出来的
不要用生成了多少文件来判断蒸馏是否完成。
更有效的方式,是拿真实问题测试它。
第一类:事实题
让它回答某个规则是怎么定义的,并给出原文页码、视频时间戳或来源链接。
第二类:场景题
换一个课程里没有出现过的商品和数据,看它能不能选择正确的方法,而不是机械复述原案例。
第三类:反例题
故意缺少利润、样本量、购买周期或类目基准,看它会不会提醒补数据,而不是强行给结论。
第四类:冲突题
同时提供旧平台规则、新平台公告和讲师经验,看它能否区分时间、来源和证据等级。
最后再问自己七个问题:
- 遇到真实问题时,它知道应该读取哪部分资料吗?
- 能给出原始依据吗?
- 能区分事实、观点和推断吗?
- 能说明适用条件和例外吗?
- 数据不足时会拒绝乱下结论吗?
- 能给出可执行的下一步吗?
- 规则更新后,能找到受影响的内容吗?
这些问题基本都能通过,资料才算开始从“收藏”变成“能力”。











