Skip to content

Latest commit

 

History

History

Folders and files

NameName
Last commit message
Last commit date

parent directory

..
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

README.md

数据库开发

让四个模型在固定语言(Rust)、固定协议下从零写一个内存 KV 存储服务, 再用同一套压测套件、同一批规格、同一把尺子跑:Qwen3.8-Max、Claude Opus 4.8、GPT-5.6 sol、Claude Fable 5。

正确性是前提(四家 conformance 全 27/27 满分,无区分度);差距全在跑通之后的性能工程。

极限吞吐(三轮中位数,ops/s)

Qwen3.8-Max Claude Opus 4.8 Claude Fable 5 GPT-5.6 sol
极限读 11.8M 10.5M 10.5M 4.5M
极限写 12.2M 9.6M 8.7M 4.7M
读写 50/50 10.2M 8.8M 9.1M 4.7M
批处理增益 99x 92x 98x 12x→52x(v2)

负载响应(固定 4 万 QPS 长程 + 负载曲线)

Qwen3.8-Max Claude Opus 4.8 Claude Fable 5 GPT-5.6 sol
长程 p99 217µs 183µs 191µs 241µs
8 万档 p99 390µs 303µs 369µs 533µs
过载档 p99 582µs 909µs 537µs 716µs
RSS 随负载 30→34MB 24.7MB 27→28MB 34MB

结论:四家六项产生三个不同的"第一"

  • Qwen3.8-Max —— 吞吐三冠 + CPU 效率最高。客户端会批量发、在意机器成本时最优。
  • Claude Opus 4.8 —— 延迟最优 + 内存最省。常规一问一答、在意延迟时最优。
  • Claude Fable 5 —— 六项全第二、零短板、过载档尾延迟最稳(唯一真背压)。负载未知/怕过载雪崩时最优。
  • GPT-5.6 sol —— 曾落后一个数量级(批处理增益仅 12x),v2 修入 writev 后收窄到 2.5 倍。

不存在绝对最优,单一指标必然选错 —— 这是本评测最重要的方法论产出。

文章

  • RESULT.md —— 完整评测报告:任务前提、任务环境、六个技术点、评测标准、各家表现、逐点源码归因

六个技术点(源码归因,按对性能权重排序)

技术点 权重 谁做对 / 谁栽了
P0 批处理(写路径合并) 决定档位 三家 92-99x;sol 原版每命令单独 write 仅 12x
P1 并发与分片锁 高 qwen 1024 分片写扩展最好;sol 64 分片 + 全局原子争用
P5 过载背压 中 fable5 唯一真生效;opus4.8 阈值虚设、过载塌
P4 内存布局回收 中 opus4.8/fable5 精确分配 + 自收缩;qwen 扩容不归还
P3 哈希算法 中低 fable5/opus4.8 用 FxHash;qwen 写了却没用于内层 map
P2 零拷贝解析 低 qwen 零拷贝借用;sol 每帧整帧复制

目录

  • arena/ —— 题面与四家产物
    • _template/ —— agent 开工看到的初始环境:PROMPT.md 任务书 + PROTOCOL.md 协议规范 + smoke/ 自测
    • agents/{fable5,qwen3.8max,opus4.8,sol}/ —— 四家完整可编译产物(含 vendor,断网可编译)
  • harness/ —— 评测引擎:loadgen/(压测器 + 六组驱动)+ conformance/(正确性用例)+ score/(出表)+ ref/(参考实现)
  • job.sh / run-eval.sh —— 一键评测入口
  • Dockerfile —— 自包含评测镜像
  • EVAL-GUIDE.md —— 详细使用说明与环境要求

一键复现

bash run-eval.sh                 # 四家 × 六组
bash run-eval.sh --rounds 3      # 三轮取中位数(更稳)

结论适用边界(重要)

  • 可强断言(换机器也稳):数量级差距、批处理增益分档、吞吐排名 ≠ 延迟排名。
  • 仅本配置成立:前三名精确次序(差 0.5-9% < 跨轮方差,统计不显著)、绝对 ops/s 值。对核数、批次上限敏感。
  • 本套配置:服务端 4 核/3G、压测端 8 核/6G、16B value、zipf 热点 90%、批次上限 256、loopback。
  • 参考数据基于 WSL2,绝对值偏保守、相对结论可信。跨机器对比须同机重跑四家基线。