← 返回 Essays
阅读路径
  1. 总述
  2. 01 · 2023 想象
  3. 02 · 真正的 Gap
  4. 03 · 2025 闭环
  5. 04 · 2026 组织
  6. 05 · 五个修正
  7. 06 · 接下来

AI · Agent · Personal Systems

从想象
到基础设施

我如何用三年构建个人 AI 系统

2023 年,我想把所有数据喂给 GPT,让它成为最了解我的人。到了 2026 年,我发现真正有用的不是一个无所不知的模型,而是一套由数据、Agent、人工审核和输出组成的个人基础设施。

Golden CopyAgentSupervisorOutput

Three-year arc

我想做的,一直不只是聊天机器人

三年前,我把问题理解成“怎样训练一个最像我的模型”;现在,我把它理解成“怎样建立一套长期可用、权限清楚、失败可见的个人基础设施”。

模型能力是其中一层。下面还有数据入口、可信版本、权限、自动化、审核和真正到达外部世界的 output。任何一层断掉,所谓个人 AI 都只是一次漂亮的 demo。

这篇文章不是项目完成清单。我把已经跑通过的 workflow、正在统一的系统和仍在构想的方向分开写。回头看,真正改变我的往往不是最大胆的想法,而是那些小、无聊、却终于闭环的流程。

  1. 数字替身
    如果 AI 拥有我的长期数据,它能不能成为最了解我的人?
  2. 工作流
    AI 离开对话框,开始接收输入、调用工具并完成真实动作。
  3. 个人组织
    多个职责有限的 Agent 协作,人从提问者变成 Supervisor。
012023:我想做一个最了解我的 AI长期记忆 · 个人数据 · 数字替身

通用模型已经足够聪明。个人 AI 最大的 gap,不是模型不知道世界,而是它不知道我。

2023 年 8 月,我写下了一份叫《ChatGPT 的长期计划》的笔记。那时 ChatGPT 出现还不到一年。我关心的已经不只是它能不能回答问题,而是:如果一个 AI 长期拥有我的个人数据,它到底可以了解我到什么程度?

我列出文字、照片、视频、音乐、代码、健康记录、财务数据、日历、聊天和日记,然后开始问一些真正和我有关的问题:

  • 我最近几个月把时间花在了哪些事情和哪些人身上?
  • 过去几年的支出和状态受什么因素影响最大?
  • 做一个重要决定时,我过去有没有相似的记录?
  • 哪些健康变化值得我带着证据去问专业人士?
  • 能不能把旅行时随手拍的视频和照片,自动整理成一段 vlog?

我想做的是一个对我的一生拥有长期记忆的系统。它不只知道这次对话里说了什么,而是知道我过去做过什么、喜欢什么、害怕什么、哪些计划总是失败、什么情况下我的判断容易变形。

我甚至设想过让它学习我的说话方式,用我的声音回答问题,替我整理社交关系,成为一个数字版本的我。现在回头看,这份笔记很粗糙,也有一些过度乐观、侵犯隐私或根本不应该做的想法。但有一个判断后来没有变:个人 AI 的价值来自长期上下文,不只是参数量。

我当时想做的,不是更聪明的搜索框,而是一个会记得的系统。
02真正难的不是 Fine-tuning数据入口 · 权限 · 可信版本

当时我以为,只要把足够多的数据喂进去,AI 就会自然地变得了解我。后来发现完全不是这么简单。

原始聊天记录里有大量重复、表情、群聊噪音和没有上下文的碎片。照片里的同一个人可能有很多名字;健康、财务、关系数据又有完全不同的权限要求。信息分散在手机、电脑、云盘、表格、社交软件和封闭的 App 里,每个地方都有自己的格式和更新时间。

真正困难的是:

  1. 数据怎样合法、稳定地拿出来;
  2. 怎样清洗、去重并保留来源;
  3. 哪一个版本是可以信任的 golden copy;
  4. 怎样持续更新,而不是一次性导入后慢慢腐烂;
  5. 谁可以访问,什么可以撤回和删除;
  6. AI 做完以后,人怎样检查它有没有理解错。

如果同一条信息散落在五个数据库里,每个版本都不一样,AI 只是更快地制造混乱。个人数据库真正重要的能力,不是“存得多”,而是知道一条信息从哪里来、什么时候更新、谁有权读取,以及能不能被删掉。

从“什么都记录”到“只保存必要的”

2023 年的我把全面收集当作能力。现在我更在意最小必要、明确同意、本地优先、可删除和按任务授权。尤其涉及他人的聊天、照片和关系,不因为技术上能拿到,就默认我应该拿。

我还需要固定的整理习惯。模型能力再强,如果 input 永远不更新,所谓长期记忆也只是一个过期的档案馆。

032025:AI 开始离开对话框Input · Process · Output · Bottleneck

我不再只问“它知道什么”,我开始问“它可以替我完成什么”。

我用 n8n 做了一个很小的视频发布流程:手机拍完视频,文件进入工作流;模型分析内容,生成标题、描述和标签;系统上传到视频平台,发回结果通知,然后删除中间文件。

它现在看起来不复杂,但改变了我对 AI 的理解。在这以前,AI 的主要形态是一个对话框。我问一个问题,它给我一段文字。对话结束,工作也就结束了。

这个 workflow 不一样。它有明确的 input、process 和 output;会调用不同工具,完成一个真实动作,并把结果交还给我。AI 第一次不是“给建议的人”,而是进入了我的工作流。

最先跑通的,都是小闭环

Published

视频发布

上传、理解、生成 metadata、发布、通知和清理中间文件。

Analysis

时间使用

整理 Calendar 数据,看“我说我重视什么”和“我实际把时间放在哪里”的差别。

Monitoring

持续查询

把部分反复搜索变成长期运行的调查任务,有值得看的结果再回来找我。

Feedback

创作练习

让模型看练习素材,给出带时间点的候选反馈,再由我和老师判断是否成立。

这些实验让我明白:真正有用的个人 AI,不应该要求我每天打开十个产品,写十遍 prompt,再把答案手工复制到另一个地方。它应该在后台工作,只把值得我看的部分送回来。

但只要 AI 开始行动,新的问题就出现了。登录会过期,平台 API 不完整,RPA 不稳定,模型对长视频、纯音乐和细微动作的理解不可靠。一个看似简单的“自动订琴房”,瓶颈可能只是每次都要重新验证;一个“AI 钢琴老师”,可能卡在模型只能稳定分析很短的素材。

我开始在每个项目后面专门写一项:瓶颈是什么。

这是我从做 demo 走向做系统的开始。

042026:我不再想训练一个模型,而是建立一个组织Specialists · Supervisor · Reviewer

这个组织有数据入口、长期记忆、负责具体任务的 Agent、Supervisor,也有最后挑战结果的 Reviewer。

到 2026 年,我对个人 AI 的想法已经不再是“做一个懂我的 GPT”。它更像一个小型组织。我的角色也从提问的人,变成决定目标、设置边界和检查结果的人。

数据入口

系统持续接收我主动选择保存的文字、计划、照片、视频、音乐、语音、日历,以及经授权整理的健康、财务和项目运行数据。重点不再是什么都收集,而是清楚哪一份是 master copy,来源能不能追踪,更新有没有时间戳。

职责有限的 Agent

以整理照片为例,我不再让一个模型从头做到尾。它可以被拆成:

  • Ingest Agent:读取时间、地点和文件元数据;
  • Vision Agent:识别场景、事件、乐器、季节等画面信息;
  • People Agent:只在获得授权的私人环境里聚类人物;
  • Theme Agent:整理旅行、学校、音乐等主题;
  • Editor Agent:判断哪些素材是 hero、good 或 context;
  • Supervisor:按主题、时间、人物多样性和画面质量,提出一组候选供我预览。

同样的结构也可以用于视频、音乐、研究和交易系统。我不再追求一个 Agent 什么都会。我更关心一条工作链里,每一步是否足够简单,失败以后能不能看见,结果有没有审核。

统一的交互和输出

我希望把 Codex 作为主要交互入口,让不同 Agent 在后台持续工作;GPT 更像 Reviewer,在关键节点挑战结果。我的目标是:少量时间花在聊天,大部分时间花在检查真正完成的 output。

这些 output 进入不同地方:需要继续生长的原始资料留在私人知识库;数据和工具进入自己的应用;监控结果进入 Dashboard;值得公开的作品和文章进入个人网站;真正需要我决定的事情回到我面前。

Confluence 是 master copy 和原始记录,自己的网站是精华。

这不只是一条网站迁移规则,也逐渐成为我使用 AI 的规则。AI 可以处理大量原始材料,但最后被留下来的内容应该经过选择。

05三年里,我真正改变的五个判断数据 · 闭环 · 瓶颈 · 审核 · 作品

最容易犯的错误,是把项目清单当成实际成果。

  1. 数据多,不等于系统了解我。没有结构、权限和来源的数据只是负担。第一步不是上传一切,而是决定什么值得保存。
  2. AI 的价值不在回答,而在闭环。如果最后仍需要我复制、粘贴、重新整理和手工执行,它只是把脑力劳动换成了阅读劳动。
  3. 架构由瓶颈决定。很多项目不是败在模型不聪明,而是败在登录、权限、数据格式、成本和不稳定接口。解决不了瓶颈,demo 就不是系统。
  4. 人不应该退出判断链。健康、财务、交易、人际关系和公开发布可以让 AI 整理证据、提出候选、检查遗漏,但最终决定和发送动作需要明确授权。
  5. 个人网站应该保存结果,不应该倾倒数据。私人原始记录允许混乱、重复和犯错;公开内容需要经过时间和选择,真的对阅读者有价值。
现在准确的完成度

我拥有的还不是一个完整的个人 AI 操作系统。更准确地说,是一些已经跑通的 workflow、一些正在统一的数据入口,以及一套越来越清楚的架构判断。照片 Supervisor、音乐反馈、长期记忆和更多自动化仍在建设。

06从数字替身,到个人基础设施有限权限 · 可逆自动化 · 判断权

我不再特别想制造“另一个我”。我想建立的是一套不会和我争夺注意力,却可以长期帮助我工作的基础设施。

接下来我更关心三件事。

第一,决策要有历史

系统不只保存我最后做了什么,也保存当时掌握了哪些信息、为什么做、预期什么会发生。这样未来复盘时,AI 可以帮助我区分结果偏见和真正的判断错误。

第二,健康与财务是辅助,不是权威

模型可以整理趋势、找出缺口、生成去问医生或专业人士的问题,也可以检查财务记录的异常;但它不应该假装诊断、替我下单,或者因为“了解我”就绕过授权。

第三,创造工具要把我送回现实

音乐、视频、写作和照片系统的价值,不是生成更多内容淹没我,而是让我更快看见素材、得到反馈、继续练习,并把少数真正 proud 的 output 放到世界上。

它记得必要的背景,拥有有限而清楚的权限;可以执行重复任务,也会暴露自己的失败;多个 Agent 可以合作,但重要结果需要 Reviewer 和我自己确认;原始资料继续生长,真正值得留下的东西再变成作品。

我从 AI 的使用者,慢慢变成了它的 Supervisor。

个人 AI 对我来说,不再是一个更聪明的聊天窗口。它是一套长期的数据结构,一组可以工作的 Agent,一条可检查的执行链,以及我对最后结果保留的判断权。这可能才是这三年真正发生的变化。

Version & privacy

版本、事实状态与隐私边界

本文整理自 2023 年《ChatGPT 的长期计划》、2025—2026 年《AI 调研和思考》及 2026 年 5 月的 AI 项目清单。“三年”是 2023 年 8 月至 2026 年 7 月的叙事跨度。

公开版删除了联系人姓名与个人关系推断、联系方式、内部域名和执行链接、数据库结构、部署位置、健康和账户资料,以及任何冒充、未经同意采集或不应实施的早期设想。涉及他人的数据只在获得授权的私人环境中处理;公开发布和对外发送保留人工确认。

文中明确区分了已经跑通的 workflow、架构设计和仍在建设的模块,不把项目愿望写成既成事实。