AI 这一天最有意思的信号,不是又多了一个会表演的模型,而是大家都在给模型补「方向盘」。安全评测开始追踪诱导、冒充、情感依赖这类隐性风险;推理研究开始测试能否干预模型的思路;3D、agent、机器人和创意工具也都在补控制接口。换句话说,AI 要进入真实工作流,下一步不是继续放烟花,而是学会被人指挥、检查和接管。
图集中提到的主要动态:CAREBench 覆盖 12 类儿童安全风险,并测试 5 个前沿模型,失败率为 2%–34%。1 swyx 关注 Anthropic J-space 论文里的推理干预与模型自察觉现象。2 Santiago 也指出严肃 3D 生成需要更精确的场景指挥。3 Pieter Levels 展示了 Fable 把本地文件拖入 Windows 3.11、通过 WebFS 协作的实验。4 Karen X. Cheng 用 GPT Image 2 与 Seedance 2.0 复现 tiny world 编辑效果。5 AK 转推 NVIDIA Robotics 与 Hugging Face 推进开放机器人工具链。6




Comments
Sign in to comment.