返回 文章 apply CMS 文章

Together AI 首发 Thinking Machines Lab 多模态 MoE 模型 Inkling

Inkling 是一款 975B 总参数、40B 活跃参数的多模态 MoE 模型,支持文本、图像、音频输入,具备可控推理努力和 1M 上下文窗口,已在 Together AI Serverless 上线。

InklingThinking Machines LabTogether AI多模态
成长分 / 100 77 综合收获、行动、留存与影响

Together AI 首发 Thinking Machines Lab 多模态 MoE 模型 Inkling
为什么值得读了解 Inkling 的架构创新,如查询条件相对注意力、短因果卷积和共享专家汇聚 MoE。

掌握如何通过 Together AI 第 0 天无服务器 API 快速集成多模态推理能力。

关键洞察
  1. Inkling 总参数 975B,每 token 活跃参数 40B,支持 1M 上下文窗口。
  2. 架构创新包括查询条件相对注意力、短因果卷积(sconv)和共享专家汇聚 MoE。
  3. 支持文本、图像、音频三种输入,统一解码器输出文本。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7380

今天,Thinking Machines Lab 发布了 Inkling,这是一种新的多模态混合专家模型,专为令牌高效推理、原生多模态理解和广泛的任务通用性而构建。Together AI 很高兴与 Thinking Machines Lab 团队合作,使 Inkling 在我们的推理平台上可供开发者使用。

Inkling 接受文本、图像和音频输入,并通过统一的解码器架构生成文本输出。它支持可控的推理努力,允许开发者根据每个任务的需求调整模型应用的推理深度。其后训练还涵盖了广泛的能力,包括科学推理、编码、智能体工作流、预测和校准预测。

在底层,Inkling 引入了超越传统仅解码器 Transformer 的多项架构创新,包括查询条件相对注意力、整个模型中的短因果卷积,以及带有共享专家汇聚的混合专家架构。这些组件共同设计用于支持强大的推理和多模态能力,同时保持高效的模型执行。大规模高效地服务它并非易事,而这正是 Together AI 推理栈所优化的负载类型,因此您可以在生产推理中实际获得模型的效率提升。在 Together AI 上,Inkling 运行在优化的 基于 FlashAttention-4 的注意力内核 上,该内核旨在高效支持其查询条件相对注意力机制在生产中的应用。

祝贺 Thinking Machines Lab 团队发布此模型。

Inkling 概览

令牌高效、可控的推理: 开发者可以调整推理努力,以平衡不同工作负载的推理深度、令牌使用和延迟。原生多模态输入: Inkling 接受音频、图像和文本输入,并通过单一模型生成文本输出。广泛的任务通用性: 该模型在推理、编码、智能体、预测和校准预测任务上进行了后训练。差异化的架构: Inkling 结合了分组查询注意力、学习相对位置偏置、短因果卷积和共享汇聚 MoE 路由。强大的初步评估: 在其最高评估努力设置下,Inkling 在科学推理、数学、编码、智能体、视觉和音频基准测试中表现出强劲结果。在 Together AI 上可用: 开发者可以通过无服务器方式访问 Inkling,支持 100 万上下文窗口和 OpenAI 兼容的 API。

在具有挑战性的推理任务上表现强劲

当前 Inkling 检查点的初步评估显示,在研究生级别的科学推理和竞赛数学方面表现强劲:

这些结果指向 Inkling 的一个定义性特征:通用性。同一模型在知识密集型推理、数学问题解决、软件工程、基于浏览器的任务、视觉文档理解和音频理解方面均表现强劲。

Inkling 还在预测和校准预测任务上进行了后训练。这扩展了模型在传统问答之外的应用,适用于表示不确定性和生成良好校准估计很重要的场景。

为什么在 Together 上运行 Inkling?

第 0 天即可访问,零设置: Inkling 今天已在 Together AI Serverless 上线。无需等待容量,无需配置基础设施,无需管理 GPU。

一个端点支持完整的多模态输入: 由于 Inkling 原生接受文本、图像和音频,你不需要单独的管道或预处理服务,Together AI Serverless 通过单个 API 调用处理所有三种输入类型。这非常强大,因为 Together 的统一解决方案消除了延迟、速度和操作稳定性之间的权衡。

可控的推理努力,无需管理自己的基础设施: Inkling 可调节的推理努力设置让你在每个请求中权衡深度、延迟和 token 消耗。在 Together AI 上,你通过 API 直接控制这个拨盘,因此成本和速度调整发生在请求级别,而不是基础设施级别。

用于推理和多模态的新架构

Inkling 是一个仅解码器的混合专家模型,拥有 975B 总参数,每个 token 40B 活跃参数,以及 1M token 的上下文窗口。

Inkling 不使用 RoPE 或绝对位置嵌入,而是通过学习的、查询条件的相对偏置将 token 位置直接融入注意力机制。每个注意力层将传统的查询-键相似度分数与基于 token 之间相对距离的额外分数相结合。这为模型提供了一种灵活的机制来表示 token 顺序和附近上下文。

Inkling 在整个网络中混合了滑动窗口和完全因果注意力。标准架构使用五个局部注意力层后跟一个完全注意力层,使得大多数层能够高效地关注近期上下文,同时定期整合整个序列的信息。

该模型还引入了 sconv,一种轻量级的逐通道因果卷积,具有四个 token 的感受野。Sconv 在注意力之前应用于键和值流,以及注意力和前馈子层的输出。这些短卷积为每一层提供了另一种机制,用于组合相邻 token 之间的信息,而无需额外的完全注意力操作。

Inkling 的前馈层使用具有 共享专家汇合 的混合专家架构。对于每个 token,路由器选择少量路由专家,同时也为共享专家分配权重。与传统的共享专家 MoE 设计不同,Inkling 将共享专家和选定的路由专家一起归一化,允许共享路径在每个 token 上动态竞争混合权重。

Inkling 还支持图像和音频输入。轻量级嵌入塔将图像块和量化音频特征转换为与文本 token 相同宽度的嵌入。这些嵌入直接插入模型的输入序列,并由相同的解码器堆栈处理。

统一的文本、图像和音频输入

Inkling 接受三种输入模态:文本、图像、音频。所有三种模态由相同的解码器堆栈处理,输出为文本。

轻量级嵌入塔将图像块和量化音频特征转换为与文本 token 嵌入相同宽度的嵌入。这些表示直接插入模型的输入序列,允许语言模型联合推理文本、视觉和音频信息。

这种统一的设计使得在同一对话中结合多种输入类型的应用成为可能,例如视觉问答、文档分析、音频理解、多模态代理和工作流。

开始使用 Together Serverless 上的 Inkling 进行构建

Inkling 现在可通过 Together AI Serverless 获取。

开发者可以:

  • 使用统一模型构建文本、图像和音频应用
  • 从初始实验扩展到专用生产能力