返回 文章 apply CMS 文章

DeepSeek-V4 Pro 登陆 Together AI:512K 上下文、可控推理与缓存定价

DeepSeek-V4 Pro 在 Together AI 上提供 512K 上下文、可控推理模式和缓存定价,适合代码智能体、文档智能等长上下文场景。

DeepSeek-V4 ProTogether AI长上下文MoE
成长分 / 100 77 综合收获、行动、留存与影响

DeepSeek-V4 Pro 登陆 Together AI:512K 上下文、可控推理与缓存定价
为什么值得读了解 DeepSeek-V4 Pro 在 Together AI 上的关键特性:512K 上下文、三种推理模式、缓存输入定价。

掌握长上下文推理工作负载的典型模式,如代码智能体、文档智能、研究综合。

关键洞察
  1. DeepSeek-V4 Pro 采用 1.6T 参数 MoE 架构,激活参数 49B,支持 512K 上下文(模型原生支持 1M)。
  2. 提供非思考、高思考、最大思考三种推理模式,允许根据任务难度调整推理深度。
  3. 缓存输入定价为每 1M token 0.20 美元,相比标准输入定价降低 90% 成本。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6875

新特性

DeepSeek V4 Pro 现已在 Together AI 上提供,支持 512K token 上下文窗口,适用于长上下文推理工作负载。Together AI 上的 DeepSeek V4 Pro:

大规模 MoE 架构:

DeepSeek V4 Pro 采用 1.6T 参数的混合专家架构,激活参数为 49B。

可控推理模式:

非思考、高思考、最大思考模式让团队可以在快速响应、深度推理和最大推理努力之间进行选择。

透明的无服务器定价:

DeepSeek V4 Pro 的定价为 每 1M 输入 token 2.10 美元,每 1M 缓存输入 token 0.20 美元,每 1M 输出 token 4.40 美元。

长上下文推理改变了团队可以要求模型执行的任务。整个代码库、大型文档集、长代理轨迹和工具输出都可以放入模型的工作上下文中,而不是被压缩成脆弱的摘要。但能够使用如此多上下文的模型也是最难服务的:一个拥有百万 token 上下文的 1.6T 参数 MoE 模型,大多数团队都不希望自行部署、调优和运维。

DeepSeek-V4 Pro 现已在 Together AI(AI 原生云)上提供,因此团队可以从 512K 上下文的无服务器推理开始,然后迁移到专用基础设施以获得完整的 1M 上下文、预留容量和生产控制。DeepSeek-V4 Flash 即将推出,为团队提供另一个 V4 选项,适用于速度和成本比最大推理深度更重要的场景。

概览

专为长上下文推理打造

DeepSeek V4 Pro 专为模型需要对超过短提示进行推理的工作负载而设计:大型代码库、长技术文档、密集检索包、工具调用历史和研究语料库。

DeepSeek V4 Pro 在模型级别支持百万 token 上下文;在 Together AI 上,目前提供 512K token 上下文窗口。这一区别很重要,因为模型能力和部署服务配置并不总是一回事。Together AI 推出的 DeepSeek V4 Pro 上下文窗口专为可靠的生产服务而设计,同时仍为团队提供足够的空间来处理严肃的长上下文工作负载。

架构也很重要,因为长上下文不仅仅是产品规格。随着上下文增长,服务成本、内存压力、KV 缓存使用、延迟和并发性都成为系统设计的一部分。DeepSeek V4 Pro 使用混合注意力,结合了压缩稀疏注意力和高度压缩注意力,据 DeepSeek 报告,在百万 token 上下文下,单 token 推理 FLOPs 为 DeepSeek V3.2 的 27%,KV 缓存为 10%。

根据工作负载选择推理努力

DeepSeek V4 Pro 支持三种推理模式,因此团队可以根据任务难度匹配推理深度,而不是对所有请求一视同仁。

文档助手可能对简单提取使用非思考模式,对跨策略冲突分析使用高思考模式,仅在模型需要对困难决策进行推理时使用最大思考模式。代码代理可能对规划迁移使用高思考模式,对调试微妙的跨服务故障使用最大思考模式。

DeepSeek 报告了在编码、推理、长上下文和代理任务上的基准测试结果,包括 LiveCodeBench 93.5%、GPQA Diamond 90.1%、SWE-bench Verified 80.6%、MRCR 1M 83.5% 和 CorpusQA 1M 62.0%。

通过缓存输入定价降低重复长上下文查询的成本

长上下文系统通常会在多个问题中重复使用同一个大型上下文:仓库快照、文档包、策略档案、检索负载或长智能体轨迹。缓存输入定价使这些重复工作负载更加实用。

DeepSeek V4 Pro 的定价为每 100 万输入令牌 2.10 美元,缓存输入每 100 万令牌 0.20 美元,输出每 100 万令牌 4.40 美元。这意味着重复使用的上下文成本降低了 90%,当请求中成本较高的部分是在后续分析中重复使用的稳定文本块时,这一点至关重要。

示例模式:

  • 加载一个大型稳定上下文,例如 30 万令牌的仓库摘要、合同集或策略档案。
  • 针对同一上下文提出多个后续问题。
  • 在适用的情况下使用缓存输入定价,以大幅降低重复分析的成本。

工作负载模式

代码智能体

当智能体需要跨仓库片段、问题追踪、内部文档、先前工具调用和提议的补丁进行推理时,使用 DeepSeek V4 Pro。Think High 或 Think Max 对于规划变更、调试故障或解决跨文件依赖最为有用。

文档智能

对于需要在一次请求中比较的合同、策略集、技术手册或研究资料集,使用长上下文。Non-Think 可以处理提取和简单问答;Think High 更适合冲突分析、解释和综合。

长上下文智能体轨迹

使用 DeepSeek V4 Pro 检查长工具调用历史、中间结果和执行轨迹。更高的推理模式在决策点最为有用:当智能体需要决定是否继续、调用另一个工具、修改计划或停止时。

研究综合

对于结合论文、笔记、基准报告、检索文档和先前分析的工作流,使用 DeepSeek V4 Pro。当同一证据集在多个问题中重复使用时,缓存输入定价尤其有用。

从无服务器开始,转向预留容量

DeepSeek V4 Pro 可在 Together AI 无服务器推理和月度预留基础设施上使用。无服务器是评估、开发和可变流量的正确起点。月度预留更适合需要更可预测容量和成本控制的稳定生产需求。

对于长上下文工作负载,部署路径很重要。团队不仅在选择模型,还在选择随着上下文规模增长如何管理吞吐量、并发性、延迟、KV 缓存压力和成本。Together AI 为团队提供了一条从评估到生产的路径,无需自行搭建服务栈。

立即尝试

DeepSeek-V4 Pro 现已在 Together AI 无服务器推理和专用端点上可用。

从无服务器推理开始进行开发和评估。对于需要完整 100 万上下文、预留容量、工作负载隔离或更可预测吞吐量的生产工作负载,请联系销售部门在 Together AI 专用推理上部署 DeepSeek-V4 Pro。

开始使用

→ 按照我们的 DeepSeek-V4 快速入门指南 在几分钟内启动并运行

→ 查看 DeepSeek-V4 Pro 模型页面

→ 在 Playground 中尝试 DeepSeek-V4 Pro

联系销售 了解专用推理部署和批量定价