返回 文章 apply CMS 文章

用Goose智能体一键部署HuggingFace模型:零延迟上手新模型

一句话让智能体帮你部署HuggingFace模型到生产环境。

HuggingFace模型部署智能体Goose
成长分 / 100 73 综合收获、行动、留存与影响

用Goose智能体一键部署HuggingFace模型:零延迟上手新模型
为什么值得读了解如何用智能体消除模型部署中的专业知识壁垒,实现发布当天即可使用。

学习Together专用容器推理(DCI)的灵活性和成本优势,适合快速实验新模型。

关键洞察
  1. 智能体(Agent)能弥合部署所需的前置知识鸿沟,用户只需描述需求。
  2. 使用Goose和Together专用容器技能,一次会话即可完成从模型选择到容器运行的全流程。
  3. Together DCI提供私有GPU环境,无需管理底层基础设施,按使用付费。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:5658

开发者工作的方式正在发生实质性的转变。智能体(Agent)打开了以往难以触及的工作领域,并非因为技术上不可能,而是因为这些工作通常需要大多数人并不具备的专业知识。容器化、推理服务器配置、特定模型的环境搭建——这些任务过去要么需要深厚的专业知识,要么需要花费数小时自学才能开始。智能体提供了一种优雅的方式来弥合这些前置知识鸿沟。你描述想要什么,智能体就会填补知识空白。

这就是关键所在。不是速度,而是可及性

Netflix发布新模型的那天

Netflix最近在Hugging Face上发布了void-model。发布当天,我的本能反应一如既往:我想试试这个。但想尝试一个新模型和实际运行它是两码事。将其部署到可用环境、处理推理服务器设置、弄清楚容器配置、正确连接所有组件——这部分通常会在“这看起来很酷”和“好吧,我实际上正在使用它”之间引入一两天的延迟。

这一次,延迟基本为零。

使用Goose(一个CLI智能体运行器)结合Together的专用容器技能,我在一次会话中就从“Netflix刚发布了一个模型”到“我已经为它运行了一个容器”。智能体生成了在Together的专用容器推理(DCI)基础设施上部署void-model所需的所有代码,基本上就在发布当天。

输出在此:github.com/blainekasten/together-void-model-container

我的具体操作

整个设置分为三步。

步骤1:安装Together专用容器技能。

npx skills add togethercomputer/skills

这会引入together-dedicated-containers技能,赋予Goose与Together基础设施协作所需的特定知识:如何配置推理服务器、容器规范应如何、如何为给定模型正确连接所有组件。

步骤2:启动Goose会话并运行一个提示。

我想在Together的专用容器上部署这个模型 https://huggingface.co/netflix/void-model

终端屏幕显示void-byoc goose会话已就绪,包含部署说明和指向huggingface.co的URL。

就这样。一句话。

步骤3:坐等它工作。

然后,智能体从Hugging Face拉取模型详情,根据模型架构确定正确的推理服务器配置,生成容器配置文件,并产生一个完整、可运行的设置,全程无需我查阅任何资料或引导它完成各个步骤。

结果:blainekasten/together-void-model-container,一个干净、可用的仓库,任何人都可以用它在Together基础设施上运行void-model。

步骤4:使用你的模型!

代理部署您的应用程序后,您就可以开始对其运行推理。Together CLI 提供了轻松测试推理的命令。

该模型可从视频中移除物体及其在场景中引发的所有交互——不仅是阴影和反射等次要效果,还包括物理交互,例如移除人物时物体掉落。

我们对此模型的推理调用是异步的。因此,此请求的响应将返回一个包含标识符的负载,我们可以轮询该标识符。响应如下所示:

推理完成后,输出包含托管视频的 URL。我们可以使用 cURL 和 Together API 密钥下载它:

注意:需要 -L 来跟随存储 URL 中的 http 重定向,-O 会将输出写入本地文件。

为什么选择 Together 专用容器推理

这个故事之所以成立,是因为 Together 的专用容器推理 (DCI) 确实是运行此类模型的绝佳场所,值得解释原因。

DCI 为您提供一个私有的、GPU 支持的环境,运行您选择的模型,由 Together 完全管理。您无需争夺共享资源,无需配置自己的集群,也无需受限于固定的可用模型菜单。您提供模型;Together 处理基础设施。

这对于希望快速行动的团队来说意义重大。当 Netflix、研究实验室或开源社区发布新模型时,您几乎可以立即将其部署到生产级环境中。无需启动自己的 GPU 虚拟机,无需与推理服务器依赖项搏斗,无需等待有人在托管端点中添加支持。DCI 设计灵活:只要模型存在,您就可以部署它。

成本模型也使得实验变得容易。您只需为使用的资源付费,容器归您所有,无需管理底层计算的开销。这种设置让您能够对测试新模型说“是”,而不是将其归档到“等我有时间”的待办事项中。

如果您对 Together 的 DCI 感兴趣,请联系我们 进行设置。