XBSTACK XBSTACK
小白 / Xiaobai

小白 / Xiaobai

开发者 · 产品构建者

持续构建 AI 工程系统、开发者工具与长期数字资产。

关于作者与 XBSTACK →
DeepSeek V4-Pro-0813 与 DeepSeek Harness 功能、价格、接入和 Agent 架构解析

DeepSeek V4-Pro-0813 是什么?API 价格、接入方法与 DeepSeek Harness 解析

DeepSeek V4-Pro-0813 是什么、怎么调用、价格多少?本文整理 1M 上下文、384K 输出、API 价格、并发限制、OpenAI/Anthropic 兼容,并解析 DeepSeek Harness 的安装、能力与 developer preview 状态。

发布 · 2026-08-1514 分钟阅读XBSTACK 原创
#DeepSeek#DeepSeek V4-Pro-0813#DeepSeek V4 Pro#DeepSeek Harness#Agent Harness#AI Coding Agent#Model Review#DeepSeek 模型更新

DeepSeek V4-Pro-0813 是什么?API 价格、接入方法与 DeepSeek Harness 解析

DeepSeek V4-Pro-0813 是当前 deepseek-v4-pro 对应的官方后端版本,API 调用名仍然是 deepseek-v4-pro 官方文档同时列出 1M 上下文、最高 384K 输出、Tool Calls、Responses API、OpenAI/Anthropic 兼容接口和并发限制。另一边,DeepSeek Harness(dsh)已经作为官方开源 Agent Harness 进入 developer preview,可通过 npx @deepseek-ai/dsh web 启动 Web UI。

如果你正在搜索 DeepSeek V4-Pro-0813 是什么、API 怎么接入、当前价格是多少、DeepSeek Harness 是什么或怎么安装,这篇文章会把这些问题放在同一条开发者决策链里回答:先核对官方规格、价格和调用方式,再看 Harness 能提供哪些 Agent 运行层能力、现在是否适合生产,以及为什么它可能比单独一张 benchmark 表更值得关注。

DeepSeek V4-Pro-0813 与 DeepSeek Harness 的官方能力、API、价格与 Agent 运行层概览

先把事实边界说清楚:这不是“V4 Pro 和 Harness 都已经 GA”

DeepSeek 的官方 API 首页写得很清楚:deepseek-v4-flash 当前对应 DeepSeek-V4-Flash-0731,deepseek-v4-pro 当前对应 DeepSeek-V4-Pro-0813,调用方法不变。也就是说,对 API 用户而言,你不需要把 model 参数写成 DeepSeek-V4-Pro-0813,仍然调用 deepseek-v4-pro,后端会指向当前版本。

Harness 的状态则不一样。DeepSeek 官方 GitHub 仓库 deepseek-ai/deepseek-harness 明确写的是:DeepSeek Harness (dsh) 是由 DeepSeek AI 开发的开源 agent harness,目前处于 developer preview,并且会有 compatibility-breaking changes。 所以这篇文章不会把 Harness 写成已经稳定 GA 的成熟生产平台。它的方向已经官方化,但接口、插件和运行机制仍处于快速迭代阶段。

这个区别非常重要。模型版本更新可以直接进入 API 兼容层;Harness 则更像一个正在形成的 Agent Runtime。前者可以在已有网关里做灰度回归,后者要考虑插件生命周期、权限、文件系统边界、命令执行、安全审批和版本升级。把两件事混成一句“DeepSeek 同时发布 V4 Pro 和 Harness”会牺牲准确性,也会误导真正来找接入方案的开发者。

V4-Pro-0813 到底提供了什么:1M Context、384K 输出和完整 Agent API 面

DeepSeek 的官方 Models & Pricing页面给出的 V4-Pro-0813 规格非常明确。它和 V4-Flash 都是 1M context length,最大输出是 384K;同时支持 non-thinking 和 thinking 模式,并列出 JSON Output、Tool Calls、Responses API、Anthropic API、Chat Prefix Completion,以及非思考模式下的 FIM Completion。

对普通聊天用户来说,“1M 上下文”和“384K 输出”很容易被当成参数宣传,但放到 Agent 场景里意义完全不同。Coding Agent 不是只接收一段 prompt,它要长期处理仓库结构、依赖关系、代码片段、终端输出、测试失败、Git diff、规范文档和前几轮工具结果。上下文越长,理论上越有空间容纳完整工程状态;但真正能不能把这些信息组织得有效,仍然取决于 Harness 的 context assembly、裁剪、摘要、缓存和任务分解策略。

同样,384K 最大输出也不能简单理解成“应该让模型一次写 38 万 token”。在生产工程里,过长输出通常意味着成本、解析、超时和验证压力。它真正有价值的地方是给复杂生成保留更高上限,比如长代码迁移、文档生成、批量结构化结果,或者包含大量工具调用信息的长任务。规格是上限,不是推荐工作方式。

DeepSeek V4-Pro-0813 的 1M 上下文、384K 输出、Tool Calls 与 OpenAI/Anthropic API 能力图

API 兼容也是这次不能忽略的一点。官方首页列出了两套 base URL:OpenAI 格式仍然使用 https://api.deepseek.com,Anthropic 格式则使用 https://api.deepseek.com/anthropic。这让 DeepSeek 更容易进入现有 SDK、网关和 Coding Agent,而不是要求所有开发者围绕一个专有协议重写调用层。

一个最小的 OpenAI SDK 调用仍然可以保持非常普通的结构:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a senior software engineer."},
        {"role": "user", "content": "Review this change and identify production risks."},
    ],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

这段代码最重要的不是“能跑起来”,而是两个生产细节:第一,model 仍然写 deepseek-v4-pro;第二,如果你要做长期回归测试,日志里还应该额外记录当时官方对应的具体版本,例如 V4-Pro-0813。否则几周后模型 alias 后端再次更新,你很难解释同一测试为什么发生漂移。

当前价格怎么理解:不要再只记一个静态单价

截至 2026 年 8 月 15 日,官方价格页显示 V4-Pro 当前每百万 token 的价格是:缓存命中输入 USD 0.003625、缓存未命中输入 USD 0.435、输出 USD 0.87。V4-Flash 则是缓存命中 USD 0.0028、缓存未命中 USD 0.14、输出 USD 0.28。

但只抄这三个数字已经不够,因为 DeepSeek 同一页面已经公告:2026 年 8 月 16 日 16:00 UTC 起,API 将切换到 peak / off-peak 计费。 V4-Pro 的 off-peak 价格为缓存命中 USD 0.022、缓存未命中 USD 0.66、输出 USD 1.98;peak 则为 USD 0.044、USD 1.32、USD 3.96。换句话说,真正做生产预算时,使用时段会开始进入模型路由策略。

这会直接影响 Agent 产品怎么设计。比如代码仓库离线索引、夜间批量 review、文档重建、测试生成这类不要求即时响应的任务,可以有意识地调度到 off-peak;而交互式 Coding Agent 则需要把延迟、质量和价格一起权衡。未来如果你还只比较“每百万 token 多少钱”,而不比较缓存命中率、峰谷时段和任务类型,成本结论会越来越失真。

并发也必须放进同一个模型里看。DeepSeek 的官方 Rate Limit & Isolation页面列出 V4-Pro 账号级并发上限 500,V4-Flash 是 2500。对个人调用这通常不是瓶颈,但对多租户 SaaS、批处理、代码审查队列或多 Agent 并行执行,它会直接影响 worker 数量、排队策略、重试和模型降级逻辑。

所以更合理的产品路由不是“所有复杂问题全上 Pro”,而是:

  • 交互式复杂推理、关键代码审查、架构判断优先 Pro;
  • 高频低风险转换、分类、批量预处理优先 Flash;
  • 尽量提高 prefix/cache 命中率;
  • 可延后任务利用 off-peak;
  • 把 429、超时、模型切换写进运行时,而不是临时手工处理。

这已经开始接近 Harness 的职责范围了。

DeepSeek Harness 到底是什么:不是“聊天 UI”,而是 Agent 运行层

官方 README 对 Harness 的定义很短,但非常关键:open-source agent harness developed by DeepSeek AI。仓库当前可以通过:

npx @deepseek-ai/dsh web

启动 Web UI,默认服务在 http://127.0.0.1:3080。官方Web UI Guide进一步说明:你需要先配置模型、选择 workspace,然后 Agent 可以读取和编辑工作区文件、运行命令、委派任务、维护计划,并在权限策略要求时请求批准。

这已经足够说明 Harness 的角色。它不是模型本身,也不是简单把一个聊天输入框包在模型 API 外面。它是把模型推理变成工程行为的控制层:

  1. Context Management:决定哪些文件、历史、工具结果和任务状态进入下一轮;
  2. Planning:把目标拆成可执行步骤,并根据工具结果继续调整;
  3. Tool Execution:读文件、改代码、跑命令、调用搜索或其他插件;
  4. Workspace Boundary:确定 Agent 可以看到和修改什么;
  5. Approval / Permission:高风险操作在真正执行前进入人工或策略审批;
  6. Delegation:把任务拆给子 Agent 或其他能力模块;
  7. Observability:保留运行状态、错误和执行轨迹,便于回放与审计。

模型负责推理,Harness 负责上下文、工具、计划、审批和执行,二者共同组成 Agent

真正做过 Agent 工程的人会知道,线上失败往往并不是“模型突然不会写代码”,而是上下文装错、工具参数不合法、文件改完没有验证、命令执行没有权限边界、任务重试产生重复副作用,或者长任务状态没有正确持久化。这些问题都不在 benchmark 里,但它们决定产品是否可靠。

所以“Model + Harness = Agent”不是一句营销等式。它描述的是两个不同的工程责任域:模型决定推理能力的上限,Harness 决定这些能力能否以可控、可验证、可恢复的方式落到真实系统里。

DeepSeek 为什么现在必须做 Harness

DeepSeek 之前在 Agent 生态里并不缺入口。官方 API 文档已经提供 Claude Code、GitHub Copilot、OpenCode、Deep Code、Reasonix 等多种接入方式。例如官方 OpenCode 指南直接让用户连接 DeepSeek provider 并选择 V4-Pro;Deep Code 文档则给出 MODEL: deepseek-v4-pro 的配置;Reasonix 甚至明确把 Flash 作为高性价比日常模型,必要时切换 Pro。

问题也恰恰在这里:如果 DeepSeek 永远只做“别人 Harness 里的模型”,它拥有模型调用,但未必拥有完整的开发者工作流。 上下文怎么组织、哪些工具最常失败、用户为什么撤销修改、一次 Coding Task 哪一步最耗 token、什么时候需要人工批准,这些高价值反馈都发生在 Harness 层。

从产品战略看,Claude Code 对 Anthropic 的价值不只是“多卖 API token”,Codex 对 OpenAI 的价值也不只是一个命令行入口。它们都在形成模型与真实工程任务之间的高频反馈闭环。DeepSeek 自己做 Harness,意味着它开始尝试把这条闭环掌握在自己手里。

这里需要明确:这是 XBSTACK 基于官方产品动作做出的判断,不是 DeepSeek 官方宣布的商业战略。 但从当前事实看,这个推断有足够支撑——DeepSeek 同时维护模型 API、Agent integrations,并正式公开自己的 agent harness,说明竞争范围已经不再只停留在模型 endpoint。

对 AI 编程意味着什么:下一阶段比较的是“系统兑现率”

过去一年,开发者很容易用一张模型榜单做选型:SWE-bench 高一点、HumanEval 高一点、推理分高一点,就认为这个模型更适合编程。到了 Coding Agent 阶段,这种比较越来越不完整。

真实代码任务至少要经过这样一条链路:

用户目标 → 仓库扫描 → 上下文组装 → 计划 → 工具调用 → 文件修改 → 测试/构建 → 失败修复 → 人工审批 → 最终交付。

DeepSeek V4-Pro 与 DeepSeek Harness 驱动 Coding Agent 从上下文到代码修改、测试和交付的完整工作流

模型能力会影响每一步,但 Harness 决定这些步骤有没有被正确串起来。一个模型即使单题表现更强,如果 Harness 不会筛上下文、不会在修改后跑测试、不会识别副作用、不会保留失败日志,它在真实项目里的完成率仍然可能输给“模型稍弱但工程闭环更好”的系统。

因此我更关心四个指标,而不是只看 benchmark:

  • Task completion rate:复杂任务到底有多少能真正做完;
  • Verification rate:代码改完以后,有多少进入自动测试、lint、typecheck、build;
  • Recovery quality:失败后能不能定位错误、回滚或从安全状态恢复;
  • Human intervention cost:开发者需要在多少步骤接管、补上下文、修命令或撤销错误。

如果未来 DeepSeek Harness 能在这四点上形成稳定工程能力,它的竞争对象就不只是“另一个模型 API”,而会直接进入 Claude Code、Codex、OpenCode 这类开发者工作流的比较范围。

现在应该怎么接:模型可以进灰度,Harness 先别当强依赖

如果你已经有 DeepSeek API,V4-Pro-0813 的迁移其实不复杂。因为 deepseek-v4-pro 模型名不变,正确做法不是大规模改代码,而是做一次受控回归:固定一组真实任务,记录具体日期和版本,比较成功率、工具调用、延迟、token 消耗和失败模式。如果你的系统通过 OpenAI-compatible gateway 接入,还要验证 thinkingreasoning_content、tool calls、多轮消息回传和 streaming 是否符合当前协议要求。

如果你准备试 Harness,我建议把它放在开发环境或隔离 workspace 里,重点看五件事:

  1. 工作区访问边界是否足够明确;
  2. 高风险命令能否被审批策略拦截;
  3. 文件修改后是否形成稳定的验证闭环;
  4. 插件接口在升级后如何兼容;
  5. 运行轨迹能否支持问题定位和审计。

原因很直接:官方已经明确写了 developer preview 和 compatibility-breaking changes。一个 preview 项目可以非常有价值,但“值得跟踪”和“适合作为生产关键依赖”是两个完全不同的判断。

开发者评估 DeepSeek V4-Pro-0813 与 Harness 时应检查模型回归、价格、权限、工具、验证和可观测性

V4-Pro 和 V4-Flash 怎么选:不要按“高级/低级”二分

V4-Pro 与 V4-Flash 的差异不应该理解成“Pro 好、Flash 差”。从官方价格和并发上限就能看出,它们更适合不同任务密度。Flash 当前便宜得多,并发上限也高得多;Pro 更适合把昂贵计算留给真正需要复杂推理的节点。

在 Agent Harness 里,最合理的方向反而是模型路由:文件列表整理、关键词搜索、简单分类可以走 Flash;架构决策、复杂 bug 定位、跨文件重构、最终 review 再升级到 Pro。这样做不只是省钱,也能减少所有步骤都用大模型导致的排队和延迟。

这也是为什么 Harness 会越来越重要。当一个 Agent 不再只有一个模型、一个 prompt、一次回答时,模型选择本身就变成运行时决策。 谁负责在任务不同阶段切模型、控制上下文、处理预算、决定重试?仍然是 Harness。

最终判断:这次真正值得写的不是“0813”,而是 DeepSeek 开始争夺 Agent Runtime

V4-Pro-0813 本身当然值得关注。1M context、384K 最大输出、Tool Calls、Responses API、Anthropic API、当前价格与后续峰谷计费,都直接影响开发者选型。但如果把这次变化只写成“DeepSeek 又升级了模型”,文章很快会过期,也解释不了为什么 Harness 会同时进入官方首页和开发者生态。

我认为更长期的变化是:AI 编程的竞争单位正在从 Model 变成 Model × Harness × Workflow。 模型提供智力,Harness 提供上下文、工具、权限和执行,Workflow 决定这些能力怎样进入真实团队。只有三层同时成立,模型能力才会变成稳定生产力。

对 DeepSeek 来说,这意味着它第一次更明确地从“一个极具价格竞争力的模型提供商”,向“开发者 Agent 栈的一部分”移动。这个方向现在还处于 developer preview,距离稳定生产平台还有很多工程问题要回答,但它已经值得所有做 AI Agent、Coding Agent 和开发者工具的人持续跟踪。

如果只留一句话,我会这样总结:V4-Pro-0813 决定 DeepSeek 模型有多强,Harness 决定这些能力能不能真正留在开发者的日常工作流里。

官方资料

继续阅读

继续阅读

返回专题 →
Google ADK 恢复问题实测:state_delta 丢失与 2.7.0 A2A HITL 回归Google ADK state_delta 不生效怎么办?实测 2.6.2 的 state-only resume 状态丢失,并对比 2.6.1 与 2.7.0 的 A2A HITL 消息转换回归。OpenAI Responses API 中断流后,为什么报 No tool call found for function call output?OpenAI Responses API 流式返回 function_call 后,如果客户端提前关闭 Stream,call_id 可能没有写入 Conversation,下一轮提交 function_call_output 就会报 400。本文结合官方 Issue 和本地状态机实验,给出判断、恢复、幂等与生产修复方案。AI Agent 数据分析实战教程:构建自动化金融研报与决策系统AI Agent 数据分析实战教程:详细讲解 AI 智能体在数据分析中的工程应用,包括自动分析流程、工具调用、安全沙箱和实际案例,揭示如何利用智能体实现可审计的数据分析闭环。AI Agent Memory System 实战:记忆分层、用户隔离、遗忘机制与长期状态管理AI Agent Memory System 实战:系统拆解 AI Agent Memory System 的生产级设计方法,覆盖短期状态、长期记忆、用户画像、业务记忆、Checkpoint、RAG 区别、权限隔离、记忆更新、遗忘机制、审计日志与评估指标,帮助开发者构建可控的智能体记忆系统。

AI 工程周报

只发真正改变工程判断的变化、故障、实验和新资产。

评论与补充证据

参与讨论

问题、验证与勘误

登录后可发表评论。所有新评论先进入审核;审核期间仅评论者本人和管理员可见,通过后才公开。

登录评论 审核后公开
正在加载评论区…