当你想把某个人的长期输出——文章、评论、视频、书籍——变成自己知识体系的一部分时,最麻烦的不是读,而是找。读过的内容散落在不同平台,想引用时翻半天,想整理成结构化资料更是无从下手。lizheng-open-context 这个开源项目,做的就是这件事:它把立正(Superlinear)的帖子、精选评论、YouTube 内容以及《真本事》这本书,整理成一份带来源的公开上下文,供 AI Agent 或 RAG 系统直接使用。
它到底整理了什么
仓库简介写得很直白:”Source-grounded public context for 立正: Superlinear posts, selected comments, YouTube, Public Axioms V1, and 《真本事》”。翻译过来就是,它把四类内容聚合到一起:Superlinear 上的帖子、经过筛选的评论、YouTube 视频内容,以及 Public Axioms V1 和《真本事》这本书。所有内容都保留来源,这意味着你引用任何一句话,都能追溯到原始出处,不会出现”不知道这话哪来的”的情况。
从技术角度看,这个项目用 Python 写成,遵循 MIT 协议,任何人都可以自由使用、修改甚至商用。仓库的代码结构并不复杂,核心价值在于它把零散内容做成了结构化数据,省去了你从不同平台手动抓取、清洗、对齐的功夫。
适合怎么用
最直接的用法是把它接入你自己的 RAG 流程。比如你在做一个关于”真本事”或”Public Axioms”主题的问答机器人,与其自己爬取网页、处理格式,不如直接用这份现成的上下文数据,它已经帮你把来源对齐好了。你只需要把数据喂给向量数据库,就能快速搭建一个能引用出处的问答系统。
另一个场景是做内容研究。想系统了解立正的核心观点,与其一篇篇刷帖子、看视频、翻书,不如直接在这份整理好的上下文里做关键词检索。它把不同媒介的内容统一成一种格式,你可以同时搜到帖子里的观点、评论里的补充、视频里的论述和书里的定义,效率比自己手工整理高得多。
对于 AI Agent 开发者也很有价值。Agent 在回答问题时经常需要引用可靠来源,这份数据天然带 grounding,能减少模型”编造出处”的问题。你可以把它作为工具的知识库,让 Agent 在回答相关问题时先检索这份上下文,再基于检索结果作答。
与自己做相比的差异
有人可能会问:这些内容我自己也能整理,为什么要用这个项目?区别在于维护成本。立正的内容在持续更新,帖子、评论、视频都在不断增加,自己手工维护很难跟上节奏。而这个项目作为开源仓库,理论上可以持续同步更新,你只需要定期拉取新版本就行。
另一个差异是它的”筛选评论”。不是所有评论都有价值,项目帮你做了初步筛选,只保留精选评论,这比自己面对海量评论无从下手要省心。加上 Public Axioms V1 这种已经结构化的公理集合,直接拿来就能用。
当然,它也有局限。目前项目在 GitHub 上约 88 个星标,属于早期阶段,数据覆盖范围取决于维护者的更新频率。如果你需要的是其他作者或更广泛的内容,这个项目就不适用了。
| 维度 | lizheng-open-context | 自己手工整理 |
|---|---|---|
| 内容来源 | 立正的多平台内容聚合 | 需自行搜集 |
| 来源标注 | 自带来源,可追溯 | 需手动记录 |
| 更新维护 | 开源仓库,可跟进 | 需自己持续投入 |
| 使用门槛 | 需懂 Python 和 RAG | 无技术门槛 |
如果你正好在研究立正的内容,又需要结构化的知识数据,这个项目值得你花一下午看看。但如果你只是随手读读,不需要系统引用,那就没必要折腾了。
FAQ:常见问题
lizheng-open-context 包含哪些内容?
它聚合了立正(Superlinear)的帖子、精选评论、YouTube 内容、Public Axioms V1 以及《真本事》这本书,所有内容都带有原始来源,方便追溯。
这个项目适合什么技术背景的人使用?
适合熟悉 Python、了解 RAG 或 AI Agent 开发的开发者。你可以把它作为知识库数据源,接入向量数据库或直接用于检索增强生成,省去自己爬取和清洗内容的步骤。
