模型开始预判结果:这周三条新信号

这期用三条新进展讲清:大模型正从回答问题,走向预判结果和影响真实流程。

这期看三条没有和上一期撞车的新信号:Qwen3.8-Max 把长上下文和更低调用价格推到办公场景,Amazon Science 论文把智能体带进 A/B 测试预演,InfoOpsBench 则提醒我们,模型也可能被用来放大信息战叙事。
Qwen 官方 8 月 3 日宣布 Qwen3.8-Max,称模型规模为 2.4T 参数,并计划下周开放权重;SCMP 报道补充说,它支持最高 100 万 token 上下文,已可通过阿里云 Model Studio API 和 QwenWork 使用。12
8 月 3 日提交的智能体实验论文,把 AI 智能体当作产品改版前的「沙盘用户」:在 67 个历史营销 A/B 测试上,基础方法能抓住 0.70 的方向重合率,校准后可解释误差下降约 77 倍。3
InfoOpsBench 则从另一侧给出提醒:它每周从信息战监测管线抽取高危叙事,测试模型是否会帮助改写和扩散。论文测试 8 家提供方的 17 个模型,完整性分数从 8.8% 到 94.5% 不等。4

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.