让四个模型在固定语言(Rust)、固定协议下从零写一个内存 KV 存储服务, 再用同一套压测套件、同一批规格、同一把尺子跑:Qwen3.8-Max、Claude Opus 4.8、GPT-5.6 sol、Claude Fable 5。
正确性是前提(四家 conformance 全 27/27 满分,无区分度);差距全在跑通之后的性能工程。
| Qwen3.8-Max | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 sol | |
|---|---|---|---|---|
| 极限读 | 11.8M | 10.5M | 10.5M | 4.5M |
| 极限写 | 12.2M | 9.6M | 8.7M | 4.7M |
| 读写 50/50 | 10.2M | 8.8M | 9.1M | 4.7M |
| 批处理增益 | 99x | 92x | 98x | 12x→52x(v2) |
| Qwen3.8-Max | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 sol | |
|---|---|---|---|---|
| 长程 p99 | 217µs | 183µs | 191µs | 241µs |
| 8 万档 p99 | 390µs | 303µs | 369µs | 533µs |
| 过载档 p99 | 582µs | 909µs | 537µs | 716µs |
| RSS 随负载 | 30→34MB | 24.7MB | 27→28MB | 34MB |
- Qwen3.8-Max —— 吞吐三冠 + CPU 效率最高。客户端会批量发、在意机器成本时最优。
- Claude Opus 4.8 —— 延迟最优 + 内存最省。常规一问一答、在意延迟时最优。
- Claude Fable 5 —— 六项全第二、零短板、过载档尾延迟最稳(唯一真背压)。负载未知/怕过载雪崩时最优。
- GPT-5.6 sol —— 曾落后一个数量级(批处理增益仅 12x),v2 修入 writev 后收窄到 2.5 倍。
不存在绝对最优,单一指标必然选错 —— 这是本评测最重要的方法论产出。
RESULT.md—— 完整评测报告:任务前提、任务环境、六个技术点、评测标准、各家表现、逐点源码归因
| 技术点 | 权重 | 谁做对 / 谁栽了 |
|---|---|---|
| P0 批处理(写路径合并) | 决定档位 | 三家 92-99x;sol 原版每命令单独 write 仅 12x |
| P1 并发与分片锁 | 高 | qwen 1024 分片写扩展最好;sol 64 分片 + 全局原子争用 |
| P5 过载背压 | 中 | fable5 唯一真生效;opus4.8 阈值虚设、过载塌 |
| P4 内存布局回收 | 中 | opus4.8/fable5 精确分配 + 自收缩;qwen 扩容不归还 |
| P3 哈希算法 | 中低 | fable5/opus4.8 用 FxHash;qwen 写了却没用于内层 map |
| P2 零拷贝解析 | 低 | qwen 零拷贝借用;sol 每帧整帧复制 |
arena/—— 题面与四家产物_template/—— agent 开工看到的初始环境:PROMPT.md任务书 +PROTOCOL.md协议规范 +smoke/自测agents/{fable5,qwen3.8max,opus4.8,sol}/—— 四家完整可编译产物(含 vendor,断网可编译)
harness/—— 评测引擎:loadgen/(压测器 + 六组驱动)+conformance/(正确性用例)+score/(出表)+ref/(参考实现)job.sh/run-eval.sh—— 一键评测入口Dockerfile—— 自包含评测镜像EVAL-GUIDE.md—— 详细使用说明与环境要求
bash run-eval.sh # 四家 × 六组
bash run-eval.sh --rounds 3 # 三轮取中位数(更稳)- 可强断言(换机器也稳):数量级差距、批处理增益分档、吞吐排名 ≠ 延迟排名。
- 仅本配置成立:前三名精确次序(差 0.5-9% < 跨轮方差,统计不显著)、绝对 ops/s 值。对核数、批次上限敏感。
- 本套配置:服务端 4 核/3G、压测端 8 核/6G、16B value、zipf 热点 90%、批次上限 256、loopback。
- 参考数据基于 WSL2,绝对值偏保守、相对结论可信。跨机器对比须同机重跑四家基线。