返回 文章 apply CMS 文章

Magnitude:面向智能体的自我优化开源推理引擎

Magnitude 是一个会针对你的硬件自我优化的开源推理引擎,让开放模型跑得更快,并一键接入你已有的智能体。

开源推理引擎智能体本地推理硬件优化
成长分 / 100 65 综合收获、行动、留存与影响

Magnitude:面向智能体的自我优化开源推理引擎
为什么值得读了解一个通过设备端内核编译与调优来提升开放模型推理速度的新方案。

获取关于内存占用、并发会话和智能体兼容性的具体优化数据。

关键洞察
  1. Magnitude 在模型运行前于用户实际设备上编译并调优内核,以贴合具体芯片。
  2. 相比 llama.cpp,在 Metal 上解码快 92%,在 CUDA 上快 19%,整体最高快 2 倍。
  3. 每个智能体少用 27% 内存,智能体停止时即释放内存。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:2502

以你的硬件允许的最快速度运行开放模型

Magnitude 是一个面向智能体的开源推理引擎,它会针对你的具体硬件进行自我优化。它在你的设备上编译并调优其内核,因此开放模型的运行速度比 llama.cpp 最高快 2 倍。一键即可连接你已经在使用的智能体(Pi、OpenCode、Hermes、Codex 等)。可在 Apple Silicon、NVIDIA、AMD 上运行,或仅靠 CPU 运行。

下载适用于 macOS、Windows 或 Linux 的 Magnitude

⭐ 帮助我们触达更多开发者,壮大 Magnitude 社区。给这个仓库点个 Star!

demo-9-29.mp4

下载 Magnitude,安装并打开应用。- 在

Discover 中选择一个推荐模型并下载它。- 在

Connections 中连接你的智能体并开始使用。

桌面应用包含 magnitude

CLI。无需单独安装。

比 llama.cpp 最高快 2 倍:在 Metal 上解码快 92%,在 CUDA 上快 19%在你的设备上调优:内核在模型运行前会在你的硬件上调优为最佳模型而打造:为流行的开放权重系列手工优化内核灵活伸缩的内存:每个智能体少用 27% 内存,智能体停止时即释放快速的并发会话:会话共享前缀缓存以避免变慢与你的智能体兼容:一键连接 Pi、OpenCode、Hermes、Codex 等免费、私密、开源:无 token 费用,数据不离开你的机器,Apache 2.0

一个会针对你的硬件进行自我优化的开源推理引擎。它以桌面应用的形式发布,可运行开放模型并将它们连接到你已经在使用的智能体。

它们发布的是为各大类硬件预编译的内核。Magnitude 会在模型运行前在你的实际设备上编译并调优其内核,因此它们能贴合你的确切芯片。查看与 llama.cpp 的基准对比。

任何 Apple Silicon、NVIDIA 或 AMD GPU,或仅靠 CPU。没有固定的最低要求。较小的机器运行较小的模型,内存越大就能运行越大的模型。

macOS、Linux 和 Windows。

完整列表见 magnitude.dev/models。我们为最流行的开放权重系列编写优化内核,这正是我们胜过通用引擎的原因。

一键连接 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi 和 Cline。其他任何工具都可通过 OpenAI 兼容 API 使用。

是的。提示词、文件和模型都留在你的机器上。模型下载完成后无需联网。