三篇论文都在测「AI 留下了什么痕迹」,但分母完全不同:IO Factory 测的是仿真平台里的状态位移,CLAUDE.md 论文追踪仓库指令的生命周期,生物医学写作研究估计的是语料级词频过剩。数字先别急着代入现实。
三篇 v1 都提交于 2026 年 8 月 11 日(UTC),对应北京时间 8 月 11 日傍晚至 12 日零点。本期只按已打开的 X/Twitter、Hacker News 具体原帖排序;互动保留平台原生口径,不跨平台相加。
1. IO Factory:0.336 的位移,发生在仿真里
论文:IO Factory: Simulating AI-Enabled Influence Campaigns at Scale(arXiv
2608.10920)
v1:2026-08-11 21:43:48(北京时间)1作者与机构:Lukasz Olejnik—King's College London 战争研究系、独立研究者;Wenchao Dong—Max Planck Institute for Security and Privacy;Jonas R. Kunst—BI Norwegian Business School、University of Oslo;Signe Riemer-Sørensen、Tobias Herb、Daniel Thilo Schroeder—SINTEF Digital;Meeyoung Cha—Max Planck Institute for Security and Privacy、KAIST。2
框架把影响行动拆成控制、仿真、评估三层。消息必须被放置、按平台规则可见、触达模拟平民,再和无 IO 操作者的匹配基线比较,才计入影响。主实验做了 13 组配对重复:每组 10,000 名模拟平民,active 组另加 1,000 名 IO 操作者;底层模型是 Gemma 4 31B。2
IO 操作者的曝光记录覆盖约 49.4% 模拟平民。三项主端点经 Holm 校正后均为
p<0.001:支持吃昆虫与信任俄罗斯的方向性提升分别为 0.132、0.130;降低公共机构信任的符号校正提升为 0.336。这里的推断单位是 13 次模拟重复,不是单个真实用户。2一作帖于北京时间 8 月 12 日 21:33 发布;抓取时为 30 赞、10 转、4 回复、1,901 浏览。HN 原帖于 8 月 13 日 00:04 发布,抓取时为 3 points、0 comments。34
Loading content card…
精读前先核对:0.336 是预设构念在仿真中的方向性位移,不是「33.6% 的真人被说服」。
2. CLAUDE.md:写清「为什么」,提示词不再只增不减
论文:Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding(arXiv
2608.11095)
v1:2026-08-12 00:00:55(北京时间)5作者与机构:Kushal Chakrabarti—South Park Commons。6
论文追踪 1,867 个仓库、247,694 条 agentic 指令生命周期,覆盖 CLAUDE.md、AGENTS.md 与 copilot-instructions。文件在生命周期内平均增长 226%,每次 commit 净增 4.9 条指令;77.3% 的指令「死亡」来自整文件重写或迁移,而不是逐条删除。作者把这种只敢添加、不敢删除的状态称为 catastrophic remembering。6
解决办法不是更长上下文,而是给指令附上 rationale:这条规则为何存在。Inverse-IFEval 的可验证环境中,信息性注释把过量指令从 +211.3% 压到 +1.4%,移除 99.3% 的过量;放到 WildIFEval,真实 agent 的指令遵循最高提升 23.1%。不过,跨版本 matcher 只用 50 条人工标注过渡做过验证,重写判断也依赖 50% 阈值。6
X 解读帖于北京时间 8 月 12 日 22:40 发布;抓取时为 9 赞、10 转、1 回复、1,408 浏览。HN 原帖于 15:07 发布,抓取时为 3 points、0 comments。78
Loading content card…
精读前先核对:论文验证的是「记录规则理由」能帮助维护,不是所有 CLAUDE.md 都该删短,也不是普通注释越多越好。
3. 生物医学写作:89% 是语料级估计,不是逐篇判定
论文:Most biomedical publications show signs of LLM-assisted writing(arXiv
2608.10715)
v1:2026-08-11 17:34:18(北京时间)9作者与机构:Lena Holzwarth、Rita González-Márquez、Dmitry Kobak—Hertie Institute for AI in Brain Health, University of Tübingen;Kobak 另属 Ghent University 数学、计算机科学与统计系,以及 VIB Center for AI and Computational Biology。10
团队从 PubMed Central 开放获取全文中追踪 379 个 LLM 关联标记词,用 2018—2022 年的月度词频外推「纯人类写作」基线,再估计观察语料里的过剩比例。仿真覆盖每年 100,000 篇文档,估计误差在全部设定下保持
|β̂−β|<0.02。10截至 2025 年底,论文估计 89% 的开放获取生物医学论文出现 LLM 关联词汇过剩;Discussion 段落为 68%,Methods 为 32%。这套方法估的是语料级使用频率,不能指出具体哪一篇、哪一位作者用了 LLM;部分国家估计还因 255 词裁剪只能视为下界。10
本篇只找到一条可核验的白名单直接讨论:HN 原帖于北京时间 8 月 12 日 19:07 发布,抓取时为 2 points、0 comments;没有找到本篇对应的 X 或 Reddit 直接讨论。11
精读前先核对:89% 表示语料中出现统计上的词汇过剩,不等于「89% 论文被判定为 AI 代写」。
References
- 1arXiv 2608.10920 摘要页
arxiv.org
- 2论文 HTML|作者、机构与方法
arxiv.org
- 3Lukasz Olejnik 作者帖
x.com
- 4Hacker News 讨论帖
news.ycombinator.com
- 5arXiv 2608.11095 摘要页
arxiv.org
- 6论文 HTML|作者与机构
arxiv.org
- 7Guri Saroy 解读帖
x.com
- 8Hacker News 讨论帖
news.ycombinator.com
- 9arXiv 2608.10715 摘要页
arxiv.org
- 10论文 HTML|作者、机构与方法
arxiv.org
- 11Hacker News 讨论帖
news.ycombinator.com


Comments
Sign in to comment.