返回 文章 apply CMS 文章

MicroLLM Lab:在浏览器中测试 7 个微型大语言模型

在浏览器里用客观测试跑 7 个微型 LLM,看谁快谁准。

微型语言模型浏览器基准测试客观评估性能证书
成长分 / 100 66 综合收获、行动、留存与影响

为什么值得读了解如何用客观检查而非主观写作质量来评估微型语言模型。

获得在浏览器本地运行模型基准测试的实践视角,数据保留在本机。

关键洞察
  1. 评估使用客观检查(正则/精确 token),而非写作质量。
  2. 允许 135M 模型失败,失败本身就是测量的一部分。
  3. 速度(tokens/s,持续解码,套件总耗时)和准确率(客观测试通过率)来自浏览器中的运行。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:834

客观检查(正则 / 精确 token),而非写作质量。允许 135M 模型失败——这正是测量本身。选择模型,然后运行。估算使用你上一次的 tok/s(如果有的话)。

每个测试的运行时间(毫秒)

每个测试的准确率

速度(tokens/s,持续解码,套件总耗时)和准确率(客观测试的通过率)来自此浏览器中的运行。数据保留在本机。图表使用每个模型的最新套件。

准确率(最新套件)

速度(平均 tok/s)

套件总耗时(毫秒)

可验证的基准证书与社交分享

生成并下载一份可验证的性能证书,包含你的设备硬件、峰值和持续 tokens/秒,并分享你的得分。

用 JavaScript 编写基准测试

编辑器会在当前源中执行 eval(),然后每个 check 会在模型的解码文本上运行。