从 370 年历史密码到 18 亿 Token 手搓系统:大模型实测跨入底层工程深水区

从 370 年历史密码到 18 亿 Token 手搓系统:大模型实测跨入底层工程深水区

本期实测覆盖 Claude Fable 5.1 在 44 分钟内自主破解 370 年未解密码、开发者消耗 18.3 亿 Token 在旧笔记本上从零手搓 DOS 操作系统并运行 Doom、GPT-6 Astra 协同构建仿真工具暴露出的交互直觉缺陷、16GB 显存通过 N-gram SSD 懒加载硬啃 68.9GB 剪枝大模型,以及小米 MiMo 接管 FPGA 硬件逻辑闭环。

在过去 24 小时里,跨平台技术讨论对大模型的检验从常规的单文件脚本生成,全面推进到底层系统引导、历史文献逆向推导与端侧极致部署的深水区。当模型被推向真实物理机、带有硬件约束的电路开发或几百年未解的学术密码时,实验室基准跑分无法展现的工程细节逐一浮现:有人用模型自主推导 44 分钟破解了 370 年前的历史谜题,有人消耗 18 亿 Token 堆出能在真机上跑游戏的自制操作系统,有人在百亿美元工业仿真工具面前遭遇模型缺乏操作直觉的现实,也有人在 16GB 显存上通过极限剪枝硬吞近 70GB 的前沿模型。
本期雷达追踪了 2026 年 9 月 13 日至 9 月 14 日期间,在 X、Reddit 与小红书上引发密集复现与工程争议的 5 组真实任务。所有案例均附带具体提示词或运行条件、资源开销以及一手可核验记录。

5 组核心实测总览

任务类型测试对象与版本核心交付与优势速度、成本与资源消耗关键局限与社区分歧
百年密码自主逆向推导Claude Fable 5.1 1发现古籍数字与段落结构的内联映射,成功还原保皇党对联并复现第二篇加密诗44 分钟自主推理,消耗 17.6 万 Token,0 人工插手 2成果由评测机构主导发布,赖于电子文本排版结构,引发关于基准测试复现性的讨论 3
裸机引导自制操作系统Claude 模型协同开发 4从零实现非 Linux/非 FreeDOS 的自制系统 EMBER,支持图形界面、触控与声卡仿真跑 Doom累计消耗 18.3 亿 Token,开发周期数天,依赖包月订阅支持非一键生成,严重依赖人工在真机拍照排错;内核缺乏现代安全隔离机制 5
复杂科学仿真工作台开发GPT-6 Astra 与 Grok 4.6 6基于 OpenModelica 搭建开源多物理域工作台 Gradara,支持图形连线与公式自动建模跨周末原型交付,配合桌面环境自动化工具排查界面故障代码吞吐极大但人机交互摩擦严重,模型频频缺少对人类操作习惯的物理直觉 7
极低配置显存压榨大模型Qwen 3.8 Flash Next(REAP-320 剪枝版)8在 16GB 显存+32GB 内存下成功加载 68.95GB 权重,达成 64k 上下文稳定运行Prefill 25.4 tok/s,Decode 18.3 tok/s,内存余量仅剩 2GBN-gram 走 SSD 懒加载,MoE 专家剪枝导致模型通识常识严重缺失,不适合泛化工作
端侧 FPGA 硬件逻辑闭环小米 MiMo Desktop 内测版 9自动编写完整 Verilog 硬件测试向量,逻辑分析仪物理采线验证波形完全正确本地客户端单机完成需求到比特流闭环,零代码编写耗时客户端尚无完整物理视听与键鼠接管,流水线长任务受制于会话配额

44 分钟与 17.6 万 Token:Claude Fable 5.1 破解 370 年历史密码

1653 年,苏格兰作家托马斯·厄克特(Thomas Urquhart)在其著作结尾留下了两行由 32 个数字组成的未解密码 Cyphral Distich。三个多世纪以来,这组密码曾出现在 1899 年的学术悬赏中,并长年被列入全球 50 大未解历史密码清单,传统密码学者尝试过频率分析与替换字表均无功而返。
Anthropic 的 Claude Code 团队与评测机构 Vals AI 近日公开了一项测试记录:Claude Fable 5.1 在没有人类干预的环境下,持续运行 44 分钟并消耗 17.6 万 Token,解开了这段长达 370 年的谜题 1
Loading content card…
测试过程展现了长程推理模型的线索捕捉能力。模型在梳理原书文本结构时,注意到密文每行正好 32 个数字,且紧跟在 32 个名为 Proquiritations 的简短小节之后。厄克特在正文中曾特意提示“没有像三十二这样能被敲定的数字”。Fable 5.1 据此推断书籍本身就是密钥:密文中第 N 个数字对应第 N 个章节中的单词序号,提取其首字母即可拼出明文 2
解密后的文本是一首献给英国国王查理二世的 32 字母押韵对联:“O GOD UPHOLD KING CHARLS THE SECOND AND / MAKE HIM THE SUPREME RULER OF THIS LAND”。随后,模型使用完全一致的逻辑,破解了厄克特在 1652 年留下的另一组 285 个数字的加密诗 Cyphral Octastich。
社区在称赞长上下文推理耐力的同时,也对该实测提出了理性审视。部分研究人员指出,该破解在很大程度上依赖数字文本排版的完整性,且发布方属于商业评测机构,目前在不同的开放材料版本中复现仍需进一步交叉检验 3

消耗 18.3 亿 Token:在旧笔记本上从零手搓 DOS 操作系统

在 Reddit 的 ClaudeAI 板块中,开发者 /u/lensdigital 分享了一项长程工程实践:在一台闲置的联想 Yoga 笔记本电脑上,让 Claude 从零构建一套名为 EMBER 的全新 DOS 风格操作系统,并通过 USB 启动盘直接引导物理硬件 4
Loading content card…
项目并非套壳 Linux 或 FreeDOS,其引导程序、图形桌面、外设驱动与软件兼容层均由模型直接编写。早期构建遭遇了显存花屏、键鼠失灵与频繁死机。作者形成了一套紧密的协作闭环:人类负责定义系统目标与架构路线,模型实现代码后进行编译并烧录 USB,人类在实体机上开机并拍摄崩溃画面与寄存器状态回传,模型针对性调试。
项目目前已开源在 GitHub 上,实现了丰富的硬件与软件功能 5
  • 完整的自制启动引导与图形视窗环境;
  • 键盘、USB 鼠标、笔记本触控板及触摸屏驱动;
  • 屏幕软键盘、文件管理器、音频播放器与资源监视器;
  • 原生 Sound Blaster 声霸卡硬件仿真与 PC Speaker 扬声器仿真;
  • 免除特殊音频补丁,直接流畅运行原版《毁灭战士》(Doom)、《街头猫》(Alley Cat)与《波斯王子》。
音频与性能是开发过程中的关键卡点。最初运行游戏时窗口拖拽会导致 CPU 占用率飙升,Claude 随后引入了一套内存缓存方案,使图形交互在老旧硬件上恢复了流畅。但这场实验的工程成本同样惊人:整个项目累计消耗了 18.3 亿 Token。作者庆幸自身依托了包月订阅,若走商业 API 计费,开销将难以承受。这也反映出当前高自主性智能体在底层系统级开发时,长上下文交互所带来的巨大推理账单。

GPT-6 Astra 协同开发工业级仿真工具,暴露出“缺乏操作直觉”

商业多领域仿真软件 Simulink 长期以功能强大和价格昂贵著称。独立开发者 Edgar A Duarte 近日在 X 上展示了利用 GPT-6 Astra 与 Grok 4.6 跨周末构建的开源替代品 Gradara 6
Loading content card…
该项目基于 OpenModelica 内核构建,提供轻量流畅的连线机制、跨物理域的方块图表,并集成了一个能够自动生成自定义方程方块的智能体 7。Astra 展现了强大的代码吞吐力与多文件组织能力,并能配合桌面操作工具自主调试部分图形渲染错误。
但在交付细节上,作者指出了顶尖大模型的明显短板:模型严重缺乏人类的实际操作直觉。尽管模型能输出逻辑成立的代码,但在连线吸附手感、窗口焦点切换和鼠标拖拽阈值等细节上,屡屡产生反直觉的设计。作者在开发期间不得不反复打字提示“你实际使用一下看看”,才能迫使模型修正那些在代码层看似正确、但在用户交互层极其别扭的缺陷。这一实测表明,在重度依赖人机交互体验的专业工具开发中,人类对物理反馈的感知仍是不可替代的校准中枢。

16GB 显存硬吃 68.9GB 权重:本地极限剪枝与 N-gram SSD 懒加载

在 Reddit 的 LocalLLaMA 社区中,针对开源大模型本地部署的硬件极限压榨再度迎来突破。开发者 /u/ironicstatistic 记录了在极其苛刻的硬件配置下,成功跑通 ~68.95GB 大小 Qwen 3.8 Flash Next 的全套配置与命令 8
测试平台的物理配置为:RTX 5060 Ti 显卡(16GB 显存)、AMD Ryzen 7 7840HS 处理器与 32GB DDR5 内存,叠加 8GB 虚拟交换空间,全系统实际可用内存仅约 44.5GB。常规量化版本在这种配置下会立刻爆显存或死机。
开发者采取的混合部署方案包含三个核心动作:
  1. 权重剪枝与分离:选用社区 REAP 剪枝版本,将原本 512 个 MoE 路由专家修剪至 320 个,将模型主体压缩至 34.89GB;
  2. N-gram 查找表外置:Qwen 3.8 架构中占据 ~29.48GB 的 N-gram 查找表由于本身不参与密集矩阵计算,通过开启 --lazy-mode on 走 SSD 懒加载映射,不占用宝贵的系统物理内存;
  3. 跨设备层级切分:通过 --n-cpu-moe 34 参数精确将 34 层 MoE 专家卸载到系统 CPU 处理,其余 48 层完全塞满 16GB 显存,留出 2GB 内存维持操作系统运转。
在 64k 上下文配置下,该方案测得 Prefill 速度约 25.4 tok/s,Decode 速度约 18.3 tok/s。但这套极限压榨方案的代价同样明显:MoE 专家的大规模剪枝破坏了模型内部的大量常识知识储备,虽然在特定逻辑生成与像素图形生成上表现稳定,但并不适合通用复杂问答。相比之下,另一组开发者在两张 R9700 配备 128GB 内存的环境中,借助优化 harness 实现了约 100 tok/s 的高吞吐,印证了端侧推理架构中存储带宽与专家完整度的核心价值。

小米 MiMo 接管真实 FPGA 工程:硬件代码闭环与端侧落地点

在国内一线开发场景中,大模型正在从纯软件开发渗透进芯片与硬件描述语言的实操中。小红书工程师 文文文文文 分享了在小米 MiMo Desktop 内测版中的硬件实测记录 9
开发者在本地 EDA 工具中新建工程并选定 FPGA 硬件型号后,将具体任务目标输入 MiMo。模型自主完成了符合时序规范的 Verilog 测试模块编写与状态机逻辑构建。人类工程师在整个流程中无需手写代码,仅负责在开发环境中点击“综合”、生成二进制比特流并烧录进物理开发板。
物理引脚外接逻辑分析仪后,抓取到的输出方波与时钟同步信号完全符合工程预期,实现了硬件描述语言从自然语言描述到物理电路波形的一次性跑通。作者指出,相比于以往模型在 Verilog 语法和时序约束上的频繁报错,新一代模型在专业硬件领域的可信度明显提高。但该工具链目前主要局限于文本与工程文件层面的输入输出,尚未集成完整的屏幕感知与硬件仪器反向联动能力,且多轮调试下的会话配额仍是长期工程化的主要阻碍。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel