客观检查(正则 / 精确 token),而非写作质量。允许 135M 模型失败——这正是测量本身。选择模型,然后运行。估算使用你上一次的 tok/s(如果有的话)。
每个测试的运行时间(毫秒)
每个测试的准确率
速度(tokens/s,持续解码,套件总耗时)和准确率(客观测试的通过率)来自此浏览器中的运行。数据保留在本机。图表使用每个模型的最新套件。
准确率(最新套件)
速度(平均 tok/s)
套件总耗时(毫秒)
可验证的基准证书与社交分享
生成并下载一份可验证的性能证书,包含你的设备硬件、峰值和持续 tokens/秒,并分享你的得分。
用 JavaScript 编写基准测试
编辑器会在当前源中执行 eval(),然后每个 check 会在模型的解码文本上运行。