· AI  · 6 分钟阅读

我用 35659 条微信发言,训练了一个"我的 AI 分身"

从导出微信聊天记录,到统计出自己的说话风格画像,再到做成可复用的 skill 和 Obsidian 库——一次数据驱动的"自我认知"。

从导出微信聊天记录,到统计出自己的说话风格画像,再到做成可复用的 skill 和 Obsidian 库——一次数据驱动的"自我认知"。

我用 35659 条微信发言,训练了一个”我的 AI 分身”

起因:想用一个数据驱动的方式认识自己

我们总说”我很了解自己”,但真到要描述自己时,往往只能说出一堆形容词。我想试试另一条路:把我说过的话全部翻出来,让数据替我回答”我是谁”。

于是有了这个项目:把微信聊天记录里”我”的发言全部导出,分析说话习惯,最终训练出一个能模仿我说话方式的 AI 分身。现在你在这个网站右下角聊天的那个”AI 分身”,说话风格就来自这次训练。

第一步:搞定微信记录导出(这一步最折腾)

微信的聊天记录存在本地,但默认是加密的。要导出,得先突破两个坎:

坎一:选对工具。 调研一圈发现这个生态很动荡——

  • 老的 WeChatMsg(留痕/MemoTrace)适配版本有限;
  • PyWxDumpEchoTrace 相继停止维护;
  • WeFlow 被腾讯以 DMCA 打击,功能全删,凉了。

最后存活且活跃发版的,只有 密语(CipherTalk)——2026 年 8 月还在更新,有 Windows 安装包,还带 CLI(支持脚本化 export)。选它。

坎二:拿到解密密钥。 记录是加密的,密钥藏在我们微信 App 的内存里,只在登录的那一瞬间初始化。所以要卡一个”时间窗口”:

退出登录 → 停在扫码界面 → 启动密钥 Hook → 立刻扫码登录 → 在登录完成的瞬间截获密钥

这一步需要一点手速和耐心,但成功后,解密和导出就全自动了。

第二步:让数据自己说话

导出后,我写了 Python 脚本对我自己的发言做统计分析——不分析聊天内容,只看”我怎么说话”。

结果很有意思(35659 条发言,剔除系统消息后有 21335 条有效文本):

维度数据
平均消息长度22.3 字(短消息 <8 字占 36%)
最爱用语气词「吧」「哈哈」「我觉得」「确实」「可以的」「没事」
高频词这个、我们、数据、可以、自己、南开、分析、大学
用表情比例2%,常用 ❤ 👌 ✅ 😋 🤔
沟通时段下午最多(40%)、晚上次之(36%)

短短几行统计,比我自己说的更诚实:我确实是个说话简短、爱用语气词、偶尔带点表情的人。

第三步:做成 skill 和 Obsidian 库

光有统计不够,要让它能复用。我把这套东西打成了三层:

  1. 风格画像:语气统计 + 发言样本,存成可研读的风格文档;
  2. my- 系列 skill*:my-voice-reply(用我的语气回消息)、my-style-portrait(生成我的沟通风格画像)、my-commitments(提取我说过要做什么)等——让 AI 能”用我的方式”做事;
  3. Obsidian 笔记库:把聊天记录按人、按群整理成结构化的笔记,可以长期检索。

第四步:让”分身”上岗

网站这个 AI 对话分身,就是把风格画像提炼成一段 system prompt:简短直接、爱用”吧/哈哈/我觉得”、偶尔表情、求职场景适度收敛。访客问它”你做过什么项目?“,它会像你本人一样回答——不是因为你写好了台词,而是因为它”学”过你怎么说话。

一点感悟

做完这个项目我有两个体会:

一是”数据即自我”。 我们以为的了解,往往敌不过统计出来的真相。它未必让你”更好”,但一定让你”更准确”。

二是隐私的边界要守住。 这套流程分析的是抽象的风格特征(语气、长度、用词习惯),不是聊天里的具体内容。网站上的 AI 分身只知道”我说话的风格”,不知道我和谁聊了什么——学习风格可以,暴露内容不行。这是整个项目最重要的一个原则。

如果你也想试试”用数据认识自己”,我推荐从导出记录开始,一步一步来。你会发现,那个”最熟悉的陌生人”,其实可以从自己说过的话里被重新认识一遍。

返回博客