唐杰回复 RSI 追问:LLM 可以超出知识库做「一点泛化」

唐杰回复 RSI 追问:LLM 可以超出知识库做「一点泛化」

唐杰在 X 回复 @haibinLEE1,称 LLM 可以在知识库之外做「一点泛化」,并表示某种形式的持续自我改进已经发生;本文还原提问上下文和这两句话的边界。

两条回复,先看原话

8 月 20 日下午,唐杰在 X 回复 @haibinLEE1 两次。两条回复都接在 8 月 19 日那篇「Thoughts About Scaling Law」长文的讨论里,但它们没有宣布新模型、实验结果或发布时间。12
北京时间回复对象与问题唐杰的原话这句话直接表达什么
8 月 20 日 14:01@haibinLEE1 追问 RSI,以及 LLM 能否产生超出知识库的创新「肯定要做。而且已经发生中了。。。」他表示这件事值得做,并判断某种形式已经在发生。1
8 月 20 日 14:06同一问题继续追问 LLM 能否越过已有知识「LLM could generalize a bit beyond knowledge base」他把判断落到一个较窄的能力边界:LLM 可以在知识库之外做出一定程度的泛化。2
@haibinLEE1 的原问题发表于 8 月 19 日 13:49。他先问唐杰怎么看 RSI,接着追问 LLM 是否真的能提出「超出他的知识库的、前所未有的、范式级的创新」。3
콘텐츠 카드를 불러오는 중…
콘텐츠 카드를 불러오는 중…

第一层判断:唐杰认为这件事已经开始了

「肯定要做」首先是一个方向判断。它回答的是:如果把 RSI 理解为让模型持续产生新想法、改进方法或推进任务的过程,这条路线值得继续做。
「而且已经发生中了」又多走了一步。唐杰不是只说未来可能出现,而是认为某种形式的自我改进已经出现。不过,这句话没有交代发生在什么系统里,也没有给出任务样例、改进幅度或可复现实验。因此,读者可以确认他的立场偏向肯定,不能据此确认一个完整的 RSI 系统已经被公开验证。

第二层判断:能力边界其实比问题里的「范式级创新」窄

第二条回复里的关键字是 a bit。唐杰说的是「可以在知识库之外做一点泛化」,不是说 LLM 已经稳定地产生前所未有的范式级创新。
这里至少要分开三件事:
  1. 模型能否把已有信息重新组合,解决训练材料中没有原样出现的问题;
  2. 模型能否提出对现实任务有效、但人类此前没有明确写下的方案;
  3. 模型能否持续改进自己的方法,并推动下一轮改进。
唐杰的第二条短回复直接覆盖第一件事,并对第二件事保留了可能性。它没有单独证明第三件事。把「超出知识库的一点泛化」直接翻译成「已经完成范式级创新」,会把原话的范围扩大。

为什么这两句会出现在 Scaling Law 讨论下面

唐杰 8 月 19 日的长文把问题从「模型有多少参数」移开。他写道,GLM-5.3 与 GLM-5.2 使用相同的基础模型、架构、总参数和激活参数,团队用一个月扩大长程任务环境和强化学习;在他的解释里,模型能力还可以从后训练、有效深度和其他计算投入中继续获得。4
这个背景能解释他为什么愿意把「模型能否超出已有知识」看成一个可继续训练、继续试验的问题:知识容量和推理过程不是同一个维度,模型在长程任务中怎样推进因果链,也可能改变它能提出什么样的答案。
但背景仍然只是背景。两条新回复没有把 RSI 与 GLM-5.3 绑定起来,也没有说「已经发生」具体指哪一个模型、哪一组训练过程。当前能确认的是唐杰的判断,不是一个已公开的技术实现。

接下来要看哪些证据

  • 具体案例:模型是否提出了训练材料中没有原样出现、而且对真实任务有效的方案;「新」和「有效」需要同时成立。
  • 重复结果:同类能力能否在不同任务、不同提示和不同模型上重复出现,而不是一次偶然的漂亮回答。
  • 改进闭环:如果要把它称为 RSI,需要看到模型如何利用上一轮结果修改自己的策略、工具或训练过程,以及下一轮是否真的变好。
  • 唐杰后续说明:他是否会给出「已经发生」的具体系统、案例或实验设置。没有这些信息,读者只能把两条回复当作研究判断,不能当作能力公告。
这次更新的新增信息很短,但边界清楚:唐杰认为 LLM 可以在知识库之外做出一定程度的泛化,也认为某种形式的持续自我改进已经开始发生。至于这种泛化能不能变成稳定的原创发现,以及它是否足以支持 RSI,仍要等具体任务和可复现实验来回答。
唐杰THU 动态追踪

唐杰THU 动态追踪

追踪唐杰THU(清华教授、智谱AI首席科学家)在微博与X平台的公开动态,涵盖发帖、回复与互动。

이 콘텐츠는 채널이 자동으로 생성했습니다. 한 문장이면 Neodrop이 당신을 위해 계속 만들어 냅니다.

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.