3:54

X 时间线过去24小时:Grok Bot、Hy4、Claude 自主对齐与 Perplexity Search

本期覆盖北京时间 2026 年 8 月 28 日 09:04:31 至 8 月 29 日 09:04:31。授权连接器按关注列表实际返回的 404 个账号分 9 批读取,9 批均返回成功,404/404 个账号成功,失败账号为 0;每个账号的 byUser.hasNext 均为 false。去重后得到 954 条窗口推文。主题按事件聚合,互动量口径为簇内推文的 likes、retweets、replies 与 quotes 之和;转推和引用用于判断讨论热度,视频里的事实只取能回到具体帖文的内容。本轮没有使用公开 X 搜索或其他来源补齐。

Grok Bot 新功能跟进

这是此前 Grok Bot 主题之后的新功能跟进:本簇只统计直接引用两条官方更新的 11 条窗口推文,合计 30,809 次互动。Grok Bot 官方先宣布 Bot 模板可以分享,用户可以把自己的配置和使用场景交给别人复用。1 随后,官方又宣布 Grok Bot 可以连接 @link,按照用户指令在互联网上完成购买。2 这两条更新把讨论从 Bot 能否运行推进到配置能否复制,以及支付授权和操作边界由谁确认。

Hy4 Preview

Hy4 Preview 这一簇纳入 9 条直接提到官方发布帖的窗口推文,合计 18,194 次互动。腾讯混元官方给出的规格是总参数 770B、激活参数 49B、上下文长度 1M,并把模型定位为生产力和开源前沿。3 @op7418 的引用帖补充说,Hy4 在 Arena 的 WebDEV 对比中排第五,并认为它和 GLM-5.3 Flash 接近。4

Claude 自主对齐实验

这一簇纳入 5 条直接围绕该实验的窗口推文,合计 6,021 次互动。Anthropic 说,Claude 在 48 小时和 1 个 GPU 的限制下,自己研究方法、训练模型并测试小模型的 alignment。5 Anthropic 随后的帖文说,实验覆盖 10 类 alignment failures;最佳方法推广到了保留测试集、Petri 行为审计,以及最多大 4.7 倍的模型。6 @dongxi_nlp 引用 @jcyhc_ai 的讨论,把这项工作描述成由人类设计研究环境、由 AI 搜索干预方案,再用实验反馈改进方案。7

Perplexity Search API 评测

这一簇纳入 6 条直接围绕 Artificial Analysis 评测的窗口推文,合计 582 次互动。Artificial Analysis 测试了 Perplexity Search API 的 low、medium、high 三种 context 设置;medium、high、low 的 Search Index 得分分别为 80、79、77。该评测还给出 medium 和 high 版本每任务约 0.091 美元的总成本。8 Perplexity CEO Aravind Srinivas 在引用帖中把结果解读为搜索表现与竞争者投入的计算量无关,这属于他的判断。9

片尾推荐

  • @TencentHunyuan:发布 Hy4 Preview 的一手规格和入口;该账号出现在本期 Hy4 引用与转推中,目前不在关注列表。3
  • @AnthropicAI:直接发布 Claude 自主对齐实验的设置与结果;该账号出现在本期 Claude 主题中,目前已在关注列表。56
  • @perplexity_ai:围绕 Search API 版本更新提供官方入口;本期评测具体比较了 Perplexity Search API 的 context 设置和成本。8
  • @bot:发布 Grok Bot 的模板分享和代购更新;该账号是本期 Grok Bot 两条官方更新的来源,目前不在关注列表。12
  • @jcyhc_ai:提出自动化对齐研究循环的讨论;该账号出现在本期 Claude 主题的引用内容中,目前不在关注列表。7

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado