我是怎样用AI管理1400+篇文章库的 · 知识工程
从批量下载到标签体系,老谭拆解用AI管理1400+篇文章库的完整流程,分享内容创作者可借鉴的知识工程实践。核心内容:1. 文章库管理的背景及差异化需求2. 工具如何支持本地化批量下载及其优化3. 7维标签体系的设计逻辑
KNOWLEDGE MANAGEMENT2026-07-25
知识工程· AI如何帮我打理1400+篇文章库
一个人的知识工程:从下载走向标签化
DOODLE一套系统,让信息囤积转化为知识资产
AI工作流与知识管理大家好,我是老谭。
我这1400多篇公众号文章是怎么交给AI管理的,今天就聊聊这个很实在的话题。
这是真实案例,不是空泛的方法论。我会拆开呈现文章下载、标签体系设计以及索引系统搭建的全过程。
如果你从事内容创作,云端也积压着几百上千篇不知如何利用的文章,或许能从本文获得一些启发。
01
PART
为什么要做这件事?
FROM HOARDING TO ASSET
1400多篇文章,是我日更公众号三年留下的成果。
过去我和多数人一样,文章发布后便不再处理;偶尔需要素材,只能凭记忆翻找许久,找不到就直接放弃。
去年12月,我作出一个决定:公众号转向AI方向后,「老生常谭」也换成了「AI Rollup」这个名称。
同时创办「老谭备忘录」,延续原先的泛话题风格。
要让两个号形成差异化,必须先弄清楚:
- 面向AI Rollup筛选素材:核心概念包括AI-Rollup、组织AI化、RaaS等
- 面向老谭备忘录筛选内容:创业心法、认知成长、投资思考
02
PART
第一步:批量下载,实现100%本地化
EXPORT EVERYTHING
管理文章的第一步,是把内容从微信后台搬到本地。
我找到一个开源项目:wechat-article-exporter(微信公众号文章批量下载工具)。
该项目的思路很巧妙:借助公众号后台的搜索其他公众号文章功能,反向抓取自己公众号的全部文章。
它可导出多种格式:
- HTML:100%还原排版和样式
- Markdown:便于后续编辑与索引
- JSON:提供结构化数据,方便程序处理
- Excel/Word:传统格式
后续标签化处理需要便利,文章结构也要保留下来,因此我选用了Markdown格式。
下载速度慢、元数据不能批量处理,是原版工具存在的两个问题。
因此,我用Claude Code对项目进行了优化:
- 并发由p-queue管理,工具因此具备了并发下载能力
- 基于Cheerio和Turndown,重新调整从HTML转换至Markdown的逻辑
- 标题、日期、URL等元数据现在能够自动提取
- 使用IndexedDB在本地缓存,防止重复下载
不到2小时,本地就完成了全部1400+篇文章的下载。
这一步至关重要:只有数据掌握在自己手中,才能继续进行深度加工。
03
PART
第二步:让AI读懂文章,先把标签体系设计出来
7-DIMENSIONAL TAGGING
文章虽然下载完成,得到的却仍是一批零散文本文件。
真正的知识管理,需要结构化。
一套「7维标签体系」的设计,花掉了我一天时间:
维度1:主题域(内容讲什么)
每篇文章可标注1-3个标签,例如:
- 大模型、AGI、AI能力边界 — AI基础认知
- AI-Agent智能体 — Agent、智能体、AI员工
- 组织AI化 — AI重构组织形态
- 流量方法论 — 流量背后的底层逻辑
- 创业心法 — 创业、创始人、方向选择
- 认知思维 — 认知、思维方式、心智模型
维度2:招牌概念(我的话语指纹)
这些术语由我自创,或与我形成强绑定:
- 核心投资/创业框架 — AI-Rollup
- 组织AI化 — AI改造存量组织
- 结果即服务RaaS — 商业模式主张
- 首席流量官 — 个人标签
- 十年战略 — 长期主义
- 共创 — 投资+赋能关系
维度3:体裁(采用什么形式)
- 观点评论 — 针对某件事表达判断
- 方法论干货 — 包含步骤、指南,可以复用
- 案例拆解 — 围绕具体公司/产品展开分析
- 个人随笔 — 记录心境、节奏的短文
- 深度长文 — 结构完整的重点文章
维度4:立场(论点倾向)
- 看多/乐观 — 对某项趋势作出积极判断
- 看空/警示 — 泼冷水、拆穿、揭遮羞布
- 行动号召 — 呼吁读者/企业立即行动
- 反思自省 — 修正自己过去的判断
维度5:可复用分(素材质量分档)
- 含招牌概念 + 观点长青 + 有深度论证 — 高
- 中 — 具备一定价值,但不够突出
- 低 — 纯日常随笔、过期热点、篇幅极短
维度6:实体(涉及哪些对象)
动态词表由系统自动抽取:
- DeepSeek、OpenClaw、Claude、微信、视频号...归入公司/产品
- 巴菲特、芒格、Sam Altman、马斯克...归入人物
维度7:写作用途(可以用来做什么)
- 观点素材 — 可作为论点/金句的来源
- 案例素材 — 可作为论据/例子使用
- 新文章可参照的清晰结构 — 框架模板
- 概念定义源 — 对招牌概念的权威阐述
为什么选择7维,而不采用传统文件夹分类?
一篇文章可能同时涉及AI应用、组织转型与投资逻辑,单一分类无法容纳;多维标签则能组合查询,例如:
可复用分=高 ∩ 体裁=方法论 ∩ 主题=组织AI化
关于组织AI化的方法论文章,由此能够被精准检索出来,而且具备可复用性。
我的知识图谱中,承担元数据层作用的正是这套标签体系。
04
PART
第三步:使用Claude批量标注标签
AI-POWERED TAGGING
标签体系已经设计完成,但面对1400多篇文章,不可能再逐篇手工标注。
这时,Claude便能发挥作用。
自动打标签这套流程,是我通过Claude Code写出来的:
步骤1:读取标签体系
为了让Claude明白每个标签,我把样本案例以及7维标签的判定标准和定义全部提供给它。
步骤2:批量分析文章
所有Markdown文件先由Python脚本完成遍历,Claude随后逐篇分析:
- 读取文章内容
- 按照标签体系生成7维标签
- 生成YAML格式的frontmatter
步骤3:写入元数据
以YAML frontmatter格式,将标签写入每篇文章开头:
---
title: 做减法,是最高级的护城河:AI时代的生存法则
date: 2026-02-18
url: https://mp.weixin.qq.com/s/xxx
主题域: [认知与个人成长]
招牌概念: [AI-Rollup]
体裁: 方法论干货
实体: [巴菲特]
立场: 行动号召
写作用途: [观点素材, 框架模板]
可复用分: 高
---
步骤4:人工校验
标签由Claude打完,我先抽查其中一部分;一旦发现问题,就修改标签体系的判定标准并再跑一遍。
关键在于,我并非只让AI执行标注,而是在与AI共同训练这套标签体系。
例如,有些文章被标为AI基础认知,实际却只是在AI时代背景下讨论其他话题。为此,我进一步明确标准:
AI基础认知应该是围绕AI能力边界、大模型与AGI进行判断和科普,而非在AI时代背景下讨论其他话题。
经过几轮反复迭代,标签准确度便得到提升。
读取、打标签、写入元数据和更新索引都由系统自动完成;今天(7月25日)我用这套流程处理19篇新文章,总耗时不到10分钟。
过去需要一支团队完成的工作,如今一个人借助AI即可完成。
05
PART
第四步:搭建6维索引系统
6-DIMENSIONAL INDEX
完成标签标注后,还有一个问题:怎样快速检索?
我既不想每次进入文件夹逐个翻找,也不愿依赖全文搜索碰运气。
我的目标是按任意维度组合查询,并立即定位目标文章。
于是,我创建了6个索引文件:
索引1:按照年度
索引_by_年度.md
- 2026年(47篇)
- 2025年(xxx篇)
- 2024年(xxx篇)
- ...
索引2:按照体裁
索引_by_体裁.md
- 观点评论(xxx篇)
- 方法论干货(xxx篇)
- 案例拆解(xxx篇)
- 个人随笔(xxx篇)
- 深度长文(xxx篇)
索引3:按照立场
索引_by_立场.md
- 看多/乐观(xxx篇)
- 看空/警示(xxx篇)
- 行动号召(xxx篇)
- 反思自省(xxx篇)
索引4:按照可复用分
索引_by_可复用分.md
- 高(xxx篇)— 写作系统优先调用
- 中(xxx篇)— 根据需要调用
- 低(xxx篇)— 只保留检索功能
索引5:按照主题域
索引_by_主题域.md
- AI-Agent智能体(xxx篇)
- AI基础认知(xxx篇)
- 组织AI化(xxx篇)
- 流量方法论(xxx篇)
- 创业心法(xxx篇)
- 投资逻辑(xxx篇)
- 认知思维(xxx篇)
- ...
索引6:按照招牌概念
索引_by_招牌概念.md
- AI-Rollup(42篇)
- 组织AI化(24篇)
- 结果即服务RaaS(22篇)
- 共创(14篇)
- 首席流量官(4篇)
- 十年战略(5篇)
- ...
各索引均为Markdown文件,采用统一格式,并按时间倒序排列:
## AI-Rollup (42)
日期 标题
|---|---|
从四次失败到确定性:我的创业成长史 2026/创业与商业/xxx.md 2026-07-24
十年投资路:从财务投资人到AI产业投资人 2026/投资与资本/xxx.md 2026-07-23
| ...
知识库可以从任意角度切入,因为这6个索引文件提供了6个不同视角的目录。
例如:
- 打开索引_by_招牌概念.md,回看过去42篇的写法 → 用于构思AI-Rollup相关文章
- 筛选高+方法论干货,要在索引_by_可复用分.md中完成 → 用于寻找高质量的方法论素材
- 沿时间线回顾时,打开索引_by_年度.md → 用于了解自己在某个时期的思考
Python脚本会在文章新增或标签修改后重新生成索引,因此这些索引文件可以自动更新。
06
PART
实战成果:让信息坟场变成知识金矿
WHAT CHANGED
这1400多篇文章全部整理结束后,我的感受非常真切:信息囤积与知识资产之间,只隔着一套系统。
改变1:写作效率提高10倍
过去写文章时,若要引用以前的观点,我只能凭记忆搜索,实在找不到便放弃。
现在打开索引,按主题域+招牌概念进行筛选,就能立即找到全部相关文章。
还可以优先查看高可复用分内容,调用经过深度论证的观点,从而避免重复造轮子。
写作不再从零开始,而是转向素材组装。
改变2:双号定位更加清楚
借助标签体系,我可以迅速判断:
- 面向AI Rollup判断文章适配度:核心概念包括AI-Rollup、组织AI化、RaaS等
- 面向老谭备忘录判断内容适配度:个人随笔、创业心法、认知成长
内容策略由拍脑袋转变为数据驱动。
改变3:知识复利逐渐显现
过去的文章发布之后,很快便会沉底。
如今,它们都成为可调用的模块;无论观点、案例还是框架,都能在新文章中复用、改写和升级。
我的知识复利来自这1400多篇文章,它们绝非历史包袱。
改变4:构成AI写作系统的基础设施
未来直接接入AI写作系统的,是这套已经完成标签化与索引化的内容库:
- 由AI按照主题自动调用相关素材
- 由AI学习体裁、立场、招牌概念,掌握我的写作风格
- 让AI生成文章初稿,我只负责润色
从人工写作迈向AI辅助写作,所需基础设施已经准备就绪。
07
PART
几项关键认知
KEY INSIGHTS
认知1:知识管理的本质在于减法
如果平等对待全部1400多篇文章,就等于根本没有进行管理。
真正的知识管理,是为每篇文章标记高、中、低三个等级的可复用分。
只有包含招牌概念、深度论证且观点长青的高质量文章才是核心资产,其余内容只是历史记录。
认知2:标签体系比AI工具更关键
许多人过度相信AI工具,认为只要有ChatGPT便能自动完成知识管理。
这是错的。
AI负责执行,标签体系才是真正的元规则。
只有先定义什么是好文章、什么是招牌概念以及什么叫可复用,AI才能依照规则进行分类和检索。
标签体系构成知识资产的操作系统,即使工具终会过时。
认知3:一个人+AI,能力超过一个小团队
如果在两年前搭建这套系统,至少需要:
- 1个产品经理负责设计标签体系
- 2个工程师负责爬虫和索引脚本
- 3个编辑逐篇完成标签标注
成本至少需要几十万。
而现在,我独自借助Claude Code,用1天便完成了。
这正是AI时代的生产力革命:它并非替代人,而是赋予一个人团队级的能力。
认知4:只有躬身入局,才能真正理解AI
关于AI Rollup、组织AI化和RaaS,我可以写100篇文章。
但如果我自己不用AI管理知识、不用AI优化工具、不用AI写代码,那些都是纸上谈兵。
真正理解AI的威力与边界,必须亲自躬身入局。
我的AI实验室,正是由这套知识管理系统构成的。
∞
CODA
写在最后:个人IP的第二大脑
FROM INFORMATION OVERLOAD TO KNOWLEDGE ASSET
为了整理这些文章,为什么要投入如此多的时间?很多人都这样问过老谭。
我的回答是:因为它就是我的第二大脑。
人脑记忆能力有限,但AI+标签系统能够实现:
- 精准回忆:通过任意组合查询,立即定位
- 跨时间连接:串联不同时期形成的思考
- 知识复利:让过去的积累成为未来的杠杆
AI时代,个人IP的竞争力不仅体现在内容生产上,更取决于知识管理能力。
如果你同样积累了几百上千篇文章,我建议:
- 不要让文章闲置在云端,先下载并完成本地化
- 根据自身需求设计标签体系,使AI能够读懂文章
- 让知识具备可检索、可复用、可迭代的能力,需要建立索引系统
从囤积信息走向知识资产,只需要一套系统。
而在AI时代,一个人就足以完成这套系统。
我是老谭。躬身入局推动组织AI化,同时作为产业投资人只投AI产业。今天,你开始管理自己的知识资产了吗?
附:技术栈说明
如果想复刻这套系统,可以参考我使用的工具:
第一步:下载文章
- wechat-article-exporter归类为开源项目
- 技术栈:Nuxt 3 + Vue 3 + Nitro
- 并发下载和元数据提取的优化,由Claude Code完成
第二步:完成标签化
- 工具:Claude Code (Opus 4.8)
- 方法:生成YAML frontmatter ← 批量分析文章 ← 读取标签体系
- 语言:Python 3.11 + PyYAML
第三步:生成索引
- 语言:Python 3.11
- 逻辑:生成Markdown索引 ← 按维度分组 ← 解析YAML ← 遍历所有文章
第四步:管理文件
- 结构:年份/分类/文章.md
- 索引:6个维度对应的Markdown文件
- 版本控制:Git(可选)
整套系统成本为0元(Claude订阅除外),采用的都是开源工具,并且支持私有部署。
完整的标签体系设计文档,我会分享给在公众号后台回复「知识管理」的感兴趣读者。
如果今天的内容对你有帮助,欢迎点赞、在看、收藏三连,我们下篇见
赞在看收藏THANKS FOR READING
登录查看剩余 70% 内容
-
07.29
冒险家艾略特的千年奇谭怎样搭配全武器魔石
-
07.29
符文世界龙之荒野常见问题是什么
-
07.29
洛克王国手游PVP阵容怎样搭配
-
07.29
真三国无双天下新手怎么玩
-
07.29
王者荣耀怎样发布王者状态
-
07.29
百味食光食材选购该怎么玩
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏