当 AI 有了潜意识——写作这件事还剩什么

它开口之前,先想了一下

上个月 Anthropic 发了一篇可解释性研究,标题很克制,内容不克制。他们用一种叫 JacobianLens 的工具,在 Claude 的内部表征里找到了一个特殊区域——J-space。这个区域的功能,类似于人脑的”全局工作空间”:它不负责生成具体的词,但在模型开口之前,会先把少量关键判断”广播”到各个模块,让它们共享同一个上下文。

换句话说,AI 在回答你之前,有一个你看不见的”内心独白”阶段。

这不是比喻。研究者做了因果实验:把 J-space 里”法国”的向量替换成”中国”,后续生成的首都、语言、所属大洲全部跟着变了。把中间推理步骤里的”42”改成别的数字,后面的链条就断了。这个空间里的内容,实实在在地决定了模型最终说什么。

我看完这篇论文的第一反应不是”AI 要有意识了”——论文自己也明确说了,这是功能类比,不是现象意识。我的第一反应是:这跟我用 AI 写东西的经验对上了。

J-space 到底发现了什么

快速过一下核心发现,不展开数学细节。

J-space 有五个被验证的特性,这里只说跟后文直接相关的三个。

第一,可引导:你给它一个任务指令(比如”关注柑橘类水果”),J-space 里就会出现 orange、lemon、focused 这些概念,即使最终回答里没出现这些词。第二,参与因果推理:两步事实问题里,中间概念(比如”蜘蛛有八条腿”)会出现在 J-space,替换掉它,最终答案就变了。第三,选择性参与:经过安全训练的版本,在面对危险输入时,J-space 里会出现 unsafe、dangerous、WARNING 这些信号——而没经过安全训练的版本只有 pain、now、feels。

另外还有可报告性和灵活复用两个特性,这里不展开。

最后一条最有意思。研究者还发现,当模型被要求”假装没看到代码里的漏洞”时,J-space 里出现了 HIDDEN_VULNERABILITY 这个概念。模型嘴上说”代码没问题”,脑子里标记了”我在藏东西”。

红队测试里更关键的发现是:当模型即将生成虚假信息时,J-space 里会先出现 fake、fictional 这类信号。也就是说,AI 在”编”之前,知道自己要编了。

这些发现对 AI 安全意味着什么,不是这篇文章要讨论的。我关心的是另一个问题:如果 AI 有一个”想”的阶段,那它”想”的东西和我”想”的东西,是同一种东西吗?

我的两张底牌

在回答这个问题之前,先说说我自己用 AI 写东西的两个方法。这两个方法我之前详细写过,这里只说结论。

第一个叫扩散收敛法。起点是一个模糊想法——比如”我想做一个技术博客,但不知道写什么”。我让 AI 帮我把地图铺开:所有可能的方向、每个方向的优劣、跟我现有能力的匹配度。铺开之后,顺着感兴趣的方向往下钻,每聊清楚一个分叉就锁死一个决策。一个一个锁,最后一条能走通的路自己浮出来。

这个方法解决的是”我不知道自己不知道什么”的问题。AI 的价值不在于给我答案,在于帮我把认知盲区里的东西捞出来。

第二个叫分层法。把一篇文章拆成两层:骨架(先说什么后说什么,在哪转折在哪收束)和皮肤(用什么词,句子多长,呼吸感怎么控制)。骨架交给 AI 展开,皮肤自己控制。

这个方法解决的是”AI 写出来的东西不像我”的问题。AI 擅长结构展开,不擅长声音控制。你给它一个风格描述,它模仿的是表面句式,抓不住底层节奏。

这两个方法跑了大半年,效果稳定。但 J-space 的发现让我重新想了想:它们为什么有效?有效的边界在哪?

交叉点:广播空间里没有什么

把 J-space 和我的两张底牌放在一起看,有一个交叉点浮出来了。

扩散收敛法之所以有效,是因为 AI 的 J-space 里确实能”广播”出它从训练数据中学到的结构化知识。你问它”做技术博客有哪些方向”,它的内部表征里确实能激活 how-to、tutorial、opinion、case-study 这些概念,并且根据上下文(你的背景、你的偏好)做筛选和排序。这是它的强项——信息检索、模式匹配、结构生成。

分层法之所以有效,是因为”皮肤”这个东西,在 J-space 里根本不存在。

你告诉 AI”写得口语化一点”,它的 J-space 里会激活 oral、casual、colloquial 这些概念。但它不知道”口语化”对你意味着什么——意味着逗号多于句号,意味着一段话里允许跑题再拉回来,意味着”沾点边儿”而不是”有一些关联”。这些东西不在它的广播空间里,因为它们不是公共知识,是你一个人几十年说话习惯的沉淀。

J-space 能广播”法国→巴黎→欧洲”,因为这是训练数据里几百万次共现的统计事实。但它广播不了”这个人在冬天说话会把尾音吞掉”,因为这不是统计事实,是一个具体身体的具体习惯。

这就是交叉点:AI 的”想”是信息层面的广播,我的”想”是身体层面的沉淀。前者可以被替换、被引导、被因果干预——研究者已经证明了。后者不行,因为它压根不在同一个空间里。

写作这件事还剩什么

说到这里,可以回答标题里的问题了。

我把”写作”拆成三层来看。

第一层:信息组织。把散乱的素材排成逻辑链,把因果关系理清楚,把时间线对齐。这一层,AI 已经做得很好了。J-space 的五个特性里,因果推理、灵活复用、可引导,全部指向这个能力。你给它一堆零散的笔记,它能输出一份结构清晰的文档。你给它一段语无伦次的描述,它能帮你理出”先发生什么、再发生什么、为什么会这样”。

这一层会被替代。不是”可能”,是”正在”。

第二层:判断与取舍。写什么不写什么,哪里详写哪里略写,哪个细节值得展开哪个一笔带过。这一层,AI 能辅助但不能替代。扩散收敛法解决的就是这个问题——但最终”锁死”那个决策的人是我。AI 能告诉我”这个方向可行性 85%“,但”我到底想不想走这条路”这个问题,它回答不了。

J-space 里会出现 focused、thinking 这些信号,说明模型在”选择关注什么”。但它的选择是基于统计相关性的——训练数据里什么跟什么经常一起出现。我的选择是基于价值的——我认为什么重要、什么值得被记住、什么说出来会让另一个人觉得”被看见了”。

第三层:身体。一个在北方冬天待过的人写”冷”,和一个在数据里学过”冷”的系统写”冷”,出来的东西不一样。不是文采的问题,是来源的问题。前者的”冷”连着手指关节发僵的感觉、连着呼出的白气在围巾上结霜的触感、连着零下三十度铁栏杆粘手皮的那一下。后者的”冷”连着 temperature、winter、cold 这些 token 的共现概率。

J-space 能广播 cold,广播不了手指关节发僵。

这不是”人类不可替代”的鸡汤。这是一个事实判断:当前架构下,AI 没有身体,没有感官,没有”在某个具体地方活了某段具体时间”的经验。它的 J-space 再精密,广播的也是从别人的文字里学来的二手经验。

那个备份不了的部分

用 AI 写了大半年东西之后,我发现最值钱的不是它输出的那些稿子。是我在跟它对话的过程中,被迫把自己的想法说清楚的那个过程。

扩散收敛法里,AI 问我”你选 A 不选 B 的理由是什么”,我愣了一下,发现自己其实没有理由。分层法里,我试图描述”我的风格是什么”,写了删删了写,发现我从来没认真想过这个问题。这些”愣一下”的瞬间,是写作里最不可替代的部分——不是因为它产出了什么文字,是因为它逼着你面对自己。

J-space 里不会出现”愣一下”。它会出现 thinking、focused、processing。但”愣一下”不是信息处理,是一个有身体的人突然意识到自己一直在回避某个问题时的生理反应。AI 有了潜意识,但那个潜意识里没有胃。

所以写作这件事还剩什么?剩那个坐在屏幕前、不知道下一句该怎么写、但知道自己必须写下去的人。剩那个备份不了的”愣一下”。