开发者工作的方式正在发生实质性的转变。智能体(Agent)打开了以往难以触及的工作领域,并非因为技术上不可能,而是因为这些工作通常需要大多数人并不具备的专业知识。容器化、推理服务器配置、特定模型的环境搭建——这些任务过去要么需要深厚的专业知识,要么需要花费数小时自学才能开始。智能体提供了一种优雅的方式来弥合这些前置知识鸿沟。你描述想要什么,智能体就会填补知识空白。
这就是关键所在。不是速度,而是可及性。
Netflix发布新模型的那天
Netflix最近在Hugging Face上发布了void-model。发布当天,我的本能反应一如既往:我想试试这个。但想尝试一个新模型和实际运行它是两码事。将其部署到可用环境、处理推理服务器设置、弄清楚容器配置、正确连接所有组件——这部分通常会在“这看起来很酷”和“好吧,我实际上正在使用它”之间引入一两天的延迟。
这一次,延迟基本为零。
使用Goose(一个CLI智能体运行器)结合Together的专用容器技能,我在一次会话中就从“Netflix刚发布了一个模型”到“我已经为它运行了一个容器”。智能体生成了在Together的专用容器推理(DCI)基础设施上部署void-model所需的所有代码,基本上就在发布当天。
输出在此:github.com/blainekasten/together-void-model-container
我的具体操作
整个设置分为三步。
步骤1:安装Together专用容器技能。
npx skills add togethercomputer/skills

这会引入together-dedicated-containers技能,赋予Goose与Together基础设施协作所需的特定知识:如何配置推理服务器、容器规范应如何、如何为给定模型正确连接所有组件。
步骤2:启动Goose会话并运行一个提示。
我想在Together的专用容器上部署这个模型 https://huggingface.co/netflix/void-model

就这样。一句话。
步骤3:坐等它工作。
然后,智能体从Hugging Face拉取模型详情,根据模型架构确定正确的推理服务器配置,生成容器配置文件,并产生一个完整、可运行的设置,全程无需我查阅任何资料或引导它完成各个步骤。
结果:blainekasten/together-void-model-container,一个干净、可用的仓库,任何人都可以用它在Together基础设施上运行void-model。
步骤4:使用你的模型!
代理部署您的应用程序后,您就可以开始对其运行推理。Together CLI 提供了轻松测试推理的命令。
该模型可从视频中移除物体及其在场景中引发的所有交互——不仅是阴影和反射等次要效果,还包括物理交互,例如移除人物时物体掉落。
我们对此模型的推理调用是异步的。因此,此请求的响应将返回一个包含标识符的负载,我们可以轮询该标识符。响应如下所示:
推理完成后,输出包含托管视频的 URL。我们可以使用 cURL 和 Together API 密钥下载它:
注意:需要 -L 来跟随存储 URL 中的 http 重定向,-O 会将输出写入本地文件。
为什么选择 Together 专用容器推理
这个故事之所以成立,是因为 Together 的专用容器推理 (DCI) 确实是运行此类模型的绝佳场所,值得解释原因。
DCI 为您提供一个私有的、GPU 支持的环境,运行您选择的模型,由 Together 完全管理。您无需争夺共享资源,无需配置自己的集群,也无需受限于固定的可用模型菜单。您提供模型;Together 处理基础设施。
这对于希望快速行动的团队来说意义重大。当 Netflix、研究实验室或开源社区发布新模型时,您几乎可以立即将其部署到生产级环境中。无需启动自己的 GPU 虚拟机,无需与推理服务器依赖项搏斗,无需等待有人在托管端点中添加支持。DCI 设计灵活:只要模型存在,您就可以部署它。
成本模型也使得实验变得容易。您只需为使用的资源付费,容器归您所有,无需管理底层计算的开销。这种设置让您能够对测试新模型说“是”,而不是将其归档到“等我有时间”的待办事项中。
如果您对 Together 的 DCI 感兴趣,请联系我们 进行设置。
