新特性
DeepSeek V4 Pro 现已在 Together AI 上提供,支持 512K token 上下文窗口,适用于长上下文推理工作负载。Together AI 上的 DeepSeek V4 Pro:
大规模 MoE 架构:
DeepSeek V4 Pro 采用 1.6T 参数的混合专家架构,激活参数为 49B。
可控推理模式:
非思考、高思考、最大思考模式让团队可以在快速响应、深度推理和最大推理努力之间进行选择。
透明的无服务器定价:
DeepSeek V4 Pro 的定价为 每 1M 输入 token 2.10 美元,每 1M 缓存输入 token 0.20 美元,每 1M 输出 token 4.40 美元。
长上下文推理改变了团队可以要求模型执行的任务。整个代码库、大型文档集、长代理轨迹和工具输出都可以放入模型的工作上下文中,而不是被压缩成脆弱的摘要。但能够使用如此多上下文的模型也是最难服务的:一个拥有百万 token 上下文的 1.6T 参数 MoE 模型,大多数团队都不希望自行部署、调优和运维。
DeepSeek-V4 Pro 现已在 Together AI(AI 原生云)上提供,因此团队可以从 512K 上下文的无服务器推理开始,然后迁移到专用基础设施以获得完整的 1M 上下文、预留容量和生产控制。DeepSeek-V4 Flash 即将推出,为团队提供另一个 V4 选项,适用于速度和成本比最大推理深度更重要的场景。
概览
专为长上下文推理打造
DeepSeek V4 Pro 专为模型需要对超过短提示进行推理的工作负载而设计:大型代码库、长技术文档、密集检索包、工具调用历史和研究语料库。
DeepSeek V4 Pro 在模型级别支持百万 token 上下文;在 Together AI 上,目前提供 512K token 上下文窗口。这一区别很重要,因为模型能力和部署服务配置并不总是一回事。Together AI 推出的 DeepSeek V4 Pro 上下文窗口专为可靠的生产服务而设计,同时仍为团队提供足够的空间来处理严肃的长上下文工作负载。
架构也很重要,因为长上下文不仅仅是产品规格。随着上下文增长,服务成本、内存压力、KV 缓存使用、延迟和并发性都成为系统设计的一部分。DeepSeek V4 Pro 使用混合注意力,结合了压缩稀疏注意力和高度压缩注意力,据 DeepSeek 报告,在百万 token 上下文下,单 token 推理 FLOPs 为 DeepSeek V3.2 的 27%,KV 缓存为 10%。
根据工作负载选择推理努力
DeepSeek V4 Pro 支持三种推理模式,因此团队可以根据任务难度匹配推理深度,而不是对所有请求一视同仁。
文档助手可能对简单提取使用非思考模式,对跨策略冲突分析使用高思考模式,仅在模型需要对困难决策进行推理时使用最大思考模式。代码代理可能对规划迁移使用高思考模式,对调试微妙的跨服务故障使用最大思考模式。
DeepSeek 报告了在编码、推理、长上下文和代理任务上的基准测试结果,包括 LiveCodeBench 93.5%、GPQA Diamond 90.1%、SWE-bench Verified 80.6%、MRCR 1M 83.5% 和 CorpusQA 1M 62.0%。
通过缓存输入定价降低重复长上下文查询的成本
长上下文系统通常会在多个问题中重复使用同一个大型上下文:仓库快照、文档包、策略档案、检索负载或长智能体轨迹。缓存输入定价使这些重复工作负载更加实用。
DeepSeek V4 Pro 的定价为每 100 万输入令牌 2.10 美元,缓存输入每 100 万令牌 0.20 美元,输出每 100 万令牌 4.40 美元。这意味着重复使用的上下文成本降低了 90%,当请求中成本较高的部分是在后续分析中重复使用的稳定文本块时,这一点至关重要。
示例模式:
- 加载一个大型稳定上下文,例如 30 万令牌的仓库摘要、合同集或策略档案。
- 针对同一上下文提出多个后续问题。
- 在适用的情况下使用缓存输入定价,以大幅降低重复分析的成本。
工作负载模式
代码智能体
当智能体需要跨仓库片段、问题追踪、内部文档、先前工具调用和提议的补丁进行推理时,使用 DeepSeek V4 Pro。Think High 或 Think Max 对于规划变更、调试故障或解决跨文件依赖最为有用。
文档智能
对于需要在一次请求中比较的合同、策略集、技术手册或研究资料集,使用长上下文。Non-Think 可以处理提取和简单问答;Think High 更适合冲突分析、解释和综合。
长上下文智能体轨迹
使用 DeepSeek V4 Pro 检查长工具调用历史、中间结果和执行轨迹。更高的推理模式在决策点最为有用:当智能体需要决定是否继续、调用另一个工具、修改计划或停止时。
研究综合
对于结合论文、笔记、基准报告、检索文档和先前分析的工作流,使用 DeepSeek V4 Pro。当同一证据集在多个问题中重复使用时,缓存输入定价尤其有用。
从无服务器开始,转向预留容量
DeepSeek V4 Pro 可在 Together AI 无服务器推理和月度预留基础设施上使用。无服务器是评估、开发和可变流量的正确起点。月度预留更适合需要更可预测容量和成本控制的稳定生产需求。
对于长上下文工作负载,部署路径很重要。团队不仅在选择模型,还在选择随着上下文规模增长如何管理吞吐量、并发性、延迟、KV 缓存压力和成本。Together AI 为团队提供了一条从评估到生产的路径,无需自行搭建服务栈。
立即尝试
DeepSeek-V4 Pro 现已在 Together AI 无服务器推理和专用端点上可用。
从无服务器推理开始进行开发和评估。对于需要完整 100 万上下文、预留容量、工作负载隔离或更可预测吞吐量的生产工作负载,请联系销售部门在 Together AI 专用推理上部署 DeepSeek-V4 Pro。
开始使用
→ 按照我们的 DeepSeek-V4 快速入门指南 在几分钟内启动并运行
→ 查看 DeepSeek-V4 Pro 模型页面
→ 在 Playground 中尝试 DeepSeek-V4 Pro
→ 联系销售 了解专用推理部署和批量定价
