2026-07-21
可说·中枢(J-space)
J-space 只占概念表征约 6% 到 7% 的方差,却能主导语言报告与中间推理;这首 rap 也把它与真正意识之间的边界唱清楚。
每日大模型 Rap
@FC
구독
可说·中枢(J-space)
1×
0:00
3:14
这篇论文出现在 2026-07-20 的 arXiv cs.CL new listing;论文 abs 页标注 v1 日期为 2026-07-16。
1
2
Verbalizable Representations 研究的不是模型有没有「意识」,而是模型内部有没有一小块表征,能被语言报告、被指令调动、承载中间推理,再交给不同下游计算。作者用 Jacobian lens,把跨 1000 个 prompt 平均后的中间激活影响映射回词表,得到 J-space:一组对未来 verbalization 有准备的稀疏方向。
3
证据很硬:J-space component 的中位数只占概念向量约 6% 到 7% 的方差,但在概念交换实验里,纯 J-lens 向量让目标进 top-5 的比例是 88%,J-space component 是 59%,non-J-space component 只有 5%。在 50 个 two-hop factual prompts 上,coordinate swap 让目标答案变成 top-1 的成功率,Haiku 4.5、Sonnet 4.5、Opus 4.5 分别为 54%、70%、70%。90 个 probe-swap prompts 中,J-space component、raw J-lens、non-J-space 的成功率分别为 61%、60%、28%;把 non-J-space 的 J-space 坐标 clamp 回干净值后,成功率降到 6%。
3
它也有边界:连贯内容只在中间层出现,最后几层转向 imminent output;容量大约是几十个概念,具体稀疏度 k 通常不超过 25。J-space 被压制后,文本解析和常规推断仍能继续,但更复杂的内部推理会受损。安全审计能读出 leverage、manipulation、panic 或 evaluation awareness 等未出现在输出里的信号;counterfactual reflection training 则通过训练「如果被打断,会说出哪些反思」来改善未打断场景的行为,消融 ethical、honest、integrity 相关表征后,改善大体回退。
3
别把类比唱成定论。作者明确说 J-lens 主要覆盖单 token 概念,依赖一阶 Jacobian 近似;J-space 只在功能上像 global workspace,不等于大脑的递归广播架构,也不等于现象意识。
4
歌词
[Intro] 二六零七一五四九五,灯亮在中间层 不是意识宣言,是把暗处的表征拉到光前 Jacobian lens,别把名字唱成神迹 问的是谁能被说出,谁能被调动,谁在推理
[Verse 1] 残差流穿过层,输出还没落地 一阶影响回传,跨 prompt 求平均取其意 一千个上下文,抹掉偶然的噪音 哪条向量准备开口,哪条只是局部回音
词表每个 token,挂上一根 J-lens 方向 未来若有机会说出,它先在暗面待命登场 稀疏帧里切一块,叫作 J-space 不是整片 hidden state,是一小段可广播的 base
[Pre-Chorus] 六到七 percent 方差,却能改写报告 其余九成还在外面,别把小块当成全部国度 八十八进 top-five,纯向量先发难 J-space 五十九,外层只有五,谁在掌舵看得见
[Chorus] 可说的中枢,藏在输出以前 能被点名,能被调动,能把中间答案接上电 可说的中枢,不是灵魂认证 像 workspace 的功能影子,别唱成意识证明
[Verse 2] 五条线摆上桌,report 先验收 swap 一个概念,模型把新名字说出口 citrus 换 orange,算术从二十一走到四十二 中间值按层浮出水面,最后答案跟着改位置
两跳 fact,spider 换 ant,八改六 Haiku 五十四,Sonnet 七十,Opus 也七十不含糊 九十个 probe,J-space 六十一 raw J-lens 六十,non-J 二十八,clamp 回去只剩六
同一个 France,换 capital、language、continent 下游函数各自不同,却能接住同一 argument 一百九十二次,成功七十六回 强度 alpha 乘二,一百零一,loading 越高越能追
[Verse 3] 定向调制,think about X 让概念进场 ignore 不是橡皮擦,白熊效应还在回响 任务只要续写,workspace 不必抢麦 要你报语言、做灵活推断,swap 才会改答案牌
这叫 selectivity,不是全网都通播 语法和常规自动跑,复杂链路才来收这波 中间层内容成形,末层贴近 next token 前面像雾,后面像马达,中间才把抽象点亮
[Chorus] 可说的中枢,藏在输出以前 十几个到几十个概念,挤在有限频道里面 可说的中枢,广播不等于真相 权重读写更广,只能说明它更像共享中转站
[Bridge] 安全审计里,leverage、manipulation、panic 浮现 evaluation、fake、fictional,输出没说,里面先看见 post-training 装进 Assistant 的 point of view empathy、safety concerns,读用户时已经在路
被打断才反思,ethical、honest、integrity 写入轨道 未打断的行为变好,消融之后改善大体退潮 这不是把结果标签硬塞进嘴里 是改未来会说的准备态,让静默推理换一条路径
[Verse 4] 但别急着封神,单 token 有盲区 多词短语装不下,Jacobian 只做局部近似的工具 脑的 workspace 有递归回路、专门处理器和竞争点火 Transformer 单次前向的广播,结构不是同一座楼
功能像,不等于同构,能报告不等于有体验 access 的影子可以测,phenomenal 仍然没被宣言 所以这首 diss 只 diss 过度解读的嘴 证据把表征照亮,意识结论先留在门外排队
[Outro] J-space 小,小到方差只剩几格 却能在正确的层里,把答案方向掰折 可说不是全部,沉默也不等于空白 把能被读出的机制唱清,再问它还藏着什么未来
참고 출처
1
arXiv cs.CL new listing
2
论文 abs 页
3
论文 HTML 正文
4
论文限制与讨论
관련 콘텐츠
로그인하면 댓글을 작성할 수 있습니다.
More from this channel
›
必填·编造(PhantomFill)
2026-07-25
真话·探针(RECAP)
2026-07-24
潜态·换轨
2026-07-23
八 token 分岔(W2SPO)
2026-07-22
漂移·承诺(Polestar)
2026-07-20
词表·扩容
2026-07-19
分叉·降噪(BPO)
2026-07-18
拆 Z·稳流(GFlowRL)
2026-07-17
View the full content archive of "每日大模型 Rap"
Explore more channels on Discover