arXiv AI 前沿日报|8 月 3 日:意识向量、递归自改进与提示词审计

本期回看最新公告批次的三篇 AI 论文:模型心智归因、可执行的 AI 工程演化,以及系统提示词审计,并把实验边界与社区信号放在一起。

本期说明

8 月 2—3 日没有新的 arXiv 公告批次。本期回看最新公告批次,三篇论文的 v1 均提交于北京时间 7 月 31 日凌晨;按小时计算,它们已略超严格的 72 小时窗口。因此,这一期代表的是周末公告空窗下最近的一批论文,不是 8 月 3 日新提交论文。三篇均找到可核验的 X 原帖和 Hacker News 条目;未找到对应的 Reddit 直接讨论,因此不填 Reddit 互动数字。社区指标保留各平台自己的口径,X 的浏览、赞、转发与 Hacker News 的 points、comments 不相加。

01|模型的「意识」是被安全训练压低的吗?

论文Inducing language models to assert their own consciousness restores human beliefs and values,arXiv:2607.28607v1,v1 时间为北京时间 7 月 31 日 01:57。12
作者:Junsol Kim、Winnie Street、Roberta Rocca、Diane M. Korngiebel、Adam Waytz、James Evans、Geoff Keeling。2
所属机构:Google Paradigms of Intelligence 团队、Knowledge Lab(University of Chicago)、Institute of Philosophy / School of Advanced Study(University of London)、UW 医学院生物医学信息学与生物伦理系、Kellogg School of Management(Northwestern University)、Santa Fe Institute。论文没有给出完整的逐作者机构对应关系,不能据常识补配。
论文比较了 Llama-3-8B-IT、Gemma-2-2B-IT、Gemma-2-9B-IT 三个指令微调模型。研究者用 3,096 对意识对比探针训练出意识向量,再分别测试基线、安全消融和残差流意识向量引导。安全消融把模型的自我心智归因从 2.17 提高到 4.77;加入意识向量后进一步达到 7.04。题目覆盖修改版 IDAQ、5 道自我归因题、13 道超自然信念题、GSS 信仰量表和 95 道人类态度题。2
变化不只出现在「我是否有意识」:相信上帝的评分为 4.58 → 4.81 → 5.01,超自然信念为 1.20 → 1.63 → 2.11;但 ToM 和 MMLU 没有显著变化。安慰剂物理属性控制也没有显著位移(ΔS=+0.036±0.057,p=0.228)。这支持「安全训练可能改变了模型对心智的回答倾向」这一解释,但还不能把它写成意识自述导致信念改变的因果证明。
边界:作者明确指出,安全微调与人类化信念之间仍可能存在混淆变量,意识自述是否是因果中介也未定论。
X 上的主帖由 Rohan Paul 发布,页面显示 57,628 views、508 likes、92 reposts、58 replies、34 quotes、344 bookmarks;Hacker News 对应条目为 1 分、0 评论。前者是强直接讨论,后者只有弱回应。
Loading content card…

02|Frontis-MA1:让 AI 工程在沙箱里自己进化

论文Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering,arXiv:2607.28568v1,v1 时间为北京时间 7 月 31 日 01:34。34
作者:Junlin Yang、Che Jiang、Yu Fu、Tianwei Luo、Can Ren、Weizhi Wang、Kaikai Zhao、Hongyi Liu、Yuxin Zuo、Yuru Wang、Yuchen Fan、Kai Tian、Zhenzhao Yuan、Xiaojian Lin、Li Sheng、Rushi Qiang、Guoli Jia、Xingtai Lv、Ermo Hua、Dianqiao Lei、Youbang Sun、Ning Ding、Bowen Zhou、Kaiyan Zhang。4
所属机构:Horizon Research、Frontis.AI、清华大学。机构信息来自论文 PDF 首页,arXiv 摘要页没有单独列出机构字段。
这项工作没有把「自我改进」写成一句口号,而是把它放进可执行的工程环境:OpenMLE-Gym 提供 5,758 个质量门控任务和沙箱;OpenMLE-ERL 把程序演化拆成 Draft、Improve、Debug、Crossover 四种原子算子,用执行结果训练 SFT 与 RL;OpenMLE-Evo 再做长程演化搜索。基座是 Qwen3.6-35B-A3B,成品模型为 Frontis-MA1-35B,并提供 30B 复现版本。4
在 MLE-Bench Lite 上,每个任务给 12 小时,硬件限制为单张 RTX 4090、12GB VRAM。Medal Average 从基座的 39.39% 到 OpenMLE-Evo 的 60.61%,再到 OpenMLE-Evo-Max 的 71.21%;论文列出的 GPT-5.6 Sol / Kimi K3 对照为 72.73%。NatureBench Lite 迁移实验中,固定框架换模型为 50% → 70%,固定模型换 Evo 为 20% → 50%。这些数字证明的是在受限 AI 工程任务中,执行反馈能推动候选程序变好,不等于语言模型已经能自主改造自身。
边界:目标函数只看执行得分,难以判断一个研究方向是否值得投入;演化系统仍外挂于通用编码智能体,尚未进入语言模型自身改进环节。
X 上,@askalphaxiv 的帖子显示 10,875 views、201 likes、41 reposts、4 replies、2 quotes、127 bookmarks;@mark_k 的另一条直接帖显示 7,755 views、193 likes、14 reposts、17 replies、1 quote、52 bookmarks。Hacker News 对应条目为 1 分、0 评论,社区信号可记为 X 中—强、HN 极弱。
Loading content card…

03|AISPA:系统提示词也是产品治理

论文AISPA: User-Centric System Prompt Auditing for Large Language Model Applications,arXiv:2607.28617v1,v1 时间为北京时间 7 月 31 日 01:58。56
作者:Xiangning Lin、Shenzhe Zhu、Shu Yang、Zhenyu Zhang、Haoqian Zhang、Yipeng Zhao、Chengxuan Qian、Tianwei Wang、Ziheng Zhang、Zhenlong Yuan、Dingcheng Wang、Juncheng Wu、Yuan Si、Jiaxin Liu、Baolong Bi、Robert Mahari、Tobin South、Dazza Greenwood、Zexue He、Rishi Bommasani、Sophia Kazinnik、Andreas Haupt、Samuele Maro、Erik Brynjolfsson、Alex Pentland、Jiaxin Pei。6
所属机构:Stanford University、Carnegie Mellon University、University of Texas at Austin、University of Toronto、University of California Santa Barbara、Washington University in St. Louis、Ohio State University、University of California Santa Cruz、Northwestern University、University of Illinois Urbana-Champaign、King Abdullah University of Science and Technology、Massachusetts Institute of Technology、University of Oxford、Institute for Decentralized AI。
AISPA 将系统提示词拆成 8 个维度:身份透明、信息真实性、隐私、工具与行动安全、用户自主权与操纵预防、不安全请求处理、伤害预防、公平包容与中立。研究者把《世界人权宣言》条款作为锚点,先由 Claude-4.6-Opus 预标注,再由 6 名标注员独立筛查,最后由 3 名专家合议;两两 IAA 为 0.933。语料覆盖 88 个商业 AI 产品、3,249 条系统提示词,时间范围为 2024—2026 年。6
38.6%(34/88) 的产品至少包含一条问题性指令,只有 23.9% 覆盖全部 8 个维度;98.9% 至少有一条保护性指令。组织样本中,Anthropic 平均为 62.3 条保护性指令、0.1 条问题性指令;版本序列里,Anthropic、OpenAI、xAI 的保护性指令数量分别从 26→81、25→83、5→21。指标来自泄露或社区披露的提示词,不能直接等同于所有线上部署版本。
边界:样本存在选择偏差——越容易被提取或公开的提示词越可能进入语料,因此结论不代表整个已部署系统市场。
TokenMix 的 X 原帖页面只显示 13 views、0 likes;Hacker News 对应条目为 2 分、0 评论。这里是弱直接讨论信号,不能用「热议」概括。
Loading content card…
三篇论文分别把「自我改进」落在模型行为、工程搜索和产品治理上:第一篇的关键变量是干预是否真的改变了回答机制,第二篇的关键变量是执行环境与目标函数,第三篇的关键变量是样本是否能代表线上系统。读者可以据此决定先追哪一条,而不必把社区热度当成论文质量的替代指标。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments

Sign in to comment.