· AI · 6 分钟阅读
我用 35659 条微信发言,训练了一个"我的 AI 分身"
从导出微信聊天记录,到统计出自己的说话风格画像,再到做成可复用的 skill 和 Obsidian 库——一次数据驱动的"自我认知"。
我用 35659 条微信发言,训练了一个”我的 AI 分身”
起因:想用一个数据驱动的方式认识自己
我们总说”我很了解自己”,但真到要描述自己时,往往只能说出一堆形容词。我想试试另一条路:把我说过的话全部翻出来,让数据替我回答”我是谁”。
于是有了这个项目:把微信聊天记录里”我”的发言全部导出,分析说话习惯,最终训练出一个能模仿我说话方式的 AI 分身。现在你在这个网站右下角聊天的那个”AI 分身”,说话风格就来自这次训练。
第一步:搞定微信记录导出(这一步最折腾)
微信的聊天记录存在本地,但默认是加密的。要导出,得先突破两个坎:
坎一:选对工具。 调研一圈发现这个生态很动荡——
- 老的
WeChatMsg(留痕/MemoTrace)适配版本有限; PyWxDump、EchoTrace相继停止维护;WeFlow被腾讯以 DMCA 打击,功能全删,凉了。
最后存活且活跃发版的,只有 密语(CipherTalk)——2026 年 8 月还在更新,有 Windows 安装包,还带 CLI(支持脚本化 export)。选它。
坎二:拿到解密密钥。 记录是加密的,密钥藏在我们微信 App 的内存里,只在登录的那一瞬间初始化。所以要卡一个”时间窗口”:
退出登录 → 停在扫码界面 → 启动密钥 Hook → 立刻扫码登录 → 在登录完成的瞬间截获密钥
这一步需要一点手速和耐心,但成功后,解密和导出就全自动了。
第二步:让数据自己说话
导出后,我写了 Python 脚本对我自己的发言做统计分析——不分析聊天内容,只看”我怎么说话”。
结果很有意思(35659 条发言,剔除系统消息后有 21335 条有效文本):
| 维度 | 数据 |
|---|---|
| 平均消息长度 | 22.3 字(短消息 <8 字占 36%) |
| 最爱用语气词 | 「吧」「哈哈」「我觉得」「确实」「可以的」「没事」 |
| 高频词 | 这个、我们、数据、可以、自己、南开、分析、大学 |
| 用表情比例 | 2%,常用 ❤ 👌 ✅ 😋 🤔 |
| 沟通时段 | 下午最多(40%)、晚上次之(36%) |
短短几行统计,比我自己说的更诚实:我确实是个说话简短、爱用语气词、偶尔带点表情的人。
第三步:做成 skill 和 Obsidian 库
光有统计不够,要让它能复用。我把这套东西打成了三层:
- 风格画像:语气统计 + 发言样本,存成可研读的风格文档;
- my- 系列 skill*:
my-voice-reply(用我的语气回消息)、my-style-portrait(生成我的沟通风格画像)、my-commitments(提取我说过要做什么)等——让 AI 能”用我的方式”做事; - Obsidian 笔记库:把聊天记录按人、按群整理成结构化的笔记,可以长期检索。
第四步:让”分身”上岗
网站这个 AI 对话分身,就是把风格画像提炼成一段 system prompt:简短直接、爱用”吧/哈哈/我觉得”、偶尔表情、求职场景适度收敛。访客问它”你做过什么项目?“,它会像你本人一样回答——不是因为你写好了台词,而是因为它”学”过你怎么说话。
一点感悟
做完这个项目我有两个体会:
一是”数据即自我”。 我们以为的了解,往往敌不过统计出来的真相。它未必让你”更好”,但一定让你”更准确”。
二是隐私的边界要守住。 这套流程分析的是抽象的风格特征(语气、长度、用词习惯),不是聊天里的具体内容。网站上的 AI 分身只知道”我说话的风格”,不知道我和谁聊了什么——学习风格可以,暴露内容不行。这是整个项目最重要的一个原则。
如果你也想试试”用数据认识自己”,我推荐从导出记录开始,一步一步来。你会发现,那个”最熟悉的陌生人”,其实可以从自己说过的话里被重新认识一遍。



