DeepSeek V4 Flash 可以交付结果了,Agent 开始拼 Harness 了

8 月初,AOE Tech Labs 公布了一组 Floatboat Harness 的评测结果。他们用同一个 DeepSeek-V4-Flash 0731 做了两组测试。这个模型跑在 DeepSeek 官方 Harness 上时,对 Claude Opus 4.8 五项均未胜出;接入 Floatboat Harness 后,五项全部超过 Opus 4.8。
底座模型没有变,结果却变了。
价格上的反差也很直接。DeepSeek-V4-Flash 的输入价格为 $0.14/百万 token,输出价格为 $0.28/百万 token。按 Agent 任务常见的 3:1 输入输出比折算,混合单价约为 $0.175/M。Opus 4.8 的混合单价约为 $10/M,是前者的 57.1 倍。

右图零线即 Opus 4.8 的位置,五项全部落在其右侧
条长为相对领先幅度,小字为两套系统原始得分(Floatboat : Opus 4.8)
当然,这组数据肯定不是去证明 DeepSeek-V4-Flash 本身比 Opus 4.8 更强。Benchmark 测到的是「模型 + 执行系统」的整体表现,而不是一个脱离系统独立运行的模型。
但它把一个行业内今天还没有怎么关注的问题摆到了台面上:
当大家都能调用相同模型时,Agent 产品之间的差距到底从哪里来?
Floatboat 给出的答案是 Harness,也就是模型之外那套让 Agent 真正干活的系统。它决定模型能读取什么、如何调用工具、任务中断后能否继续,以及执行了几十步以后,系统还记不记得用户最初要什么。
对于大多数没有能力训练前沿模型的创业公司来说,这比又一张模型榜单更值得研究。
Founder Park 读者福利:Floatboat Harness 限时 5 元 / $1 每月,通过专属邀请码注册,可再额外获得 2500 积分,约合 Floatboat 双周卡。
注册链接:
https://floatboat.ai/?invite=2YJHPBNL96
⬆️关注 Founder Park,最及时最干货的创业分享
我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。
如果你正在做 AI 相关的事,欢迎和我们聊聊。
01
同一个模型,
换个 Harness 能力就起飞了
先看同底座对照。
Floatboat 使用 DeepSeek-V4-Flash 0731 正式版,在五项第三方 Benchmark 上分别运行 DeepSeek 官方 Harness 和 Floatboat Harness。根据 Floatboat 公布的数据,结果如下:

这组对照有两个值得注意的地方。
其一,基线并不是「裸模型 API」,而是 DeepSeek 官方 Harness 的公开成绩。模型厂自己的工程能力也在场,因此,这比拿一款成熟产品与裸 API 对比更严格。
其二,Floatboat 没有选择成绩更低的 Preview checkpoint。以 DeepSWE 为例,早期 Preview 版本只有 7.3 分,如果拿它与 Floatboat 的 67.25 对比,提升可以写成 821%。但这会把模型自身的后训练进步也算到 Harness 头上。最终采用 0731 正式版的 54.4 分作为基线,结论没有那么夸张,却更容易解释。
五项测试使用隔离物理沙盒,输入参数保持一致;Floatboat 侧大部分模型推理由 DeepSeek 官方 API 提供。完整复现仍需要更多信息,例如重复运行次数、分数方差、token 与步数上限、失败重试策略,以及两套系统实际可调用的工具范围。
因此,现阶段最稳妥的结论是:同一个模型接入不同执行系统后,五项任务都出现了可观察的性能差异。
再看与 Opus 4.8 的比较。接入 Floatboat Harness 后,DeepSeek-V4-Flash 在五项上都超过了 Opus 4.8 对应的公开成绩,其中:
DeepSWE:Floatboat 为 67.25,Opus 4.8 为 58.0;
BrowseComp:Floatboat 为 87.80,Opus 4.8 为 84.3。
这里同样需要加一条边界:「五项超过 Opus 4.8」不等于五项全部第一。
在完整参评系统中,Floatboat 的位次分别是 AutomationBench 第 1/12、Toolathlon 第 1/7、BrowseComp 第 3/11、DeepSWE 第 4/11、Terminal Bench 2.1 第 5/12。GPT-5.6 Sol 在 BrowseComp、DeepSWE 和 Terminal Bench 上仍然更高;Claude Opus 5 在 BrowseComp 和 DeepSWE 上也高于 Floatboat。
一个成本较低的底座模型,借助执行系统进入了原本属于高价系统的性能区间。与此同时,Floatboat Harness 搭载更贵的模型时,同样取得了明显的性能增益。
这意味着,通过模型与 Harness 的组合,Agent 有机会真正做到多快好省,以更低的消耗完成更多日常任务。Agent 的性能与成本,并不只有「升级模型」这一种解法。
在今天 DeepSeek V4 Pro 0813 版本发布后,对比 Floatboat harness 与 DeepSeek V4 Pro 也可以发现,在长程任务上,Floatboat harness 搭载 DeepSeek V4 Flash 后的能力表现比 Pro 模型评分更优。

02
五项测试里,
长程任务增益最明显
把五项测试按任务长度大致排列,会看到一个有意思的现象:短程任务提升 1.9%,仓库级代码工程提升 23.6%,中间三项落在 9.6% 到 19.9% 之间。

这五个 Benchmark 的题型和评分尺度不同,不能据此证明「任务每增加一步,Harness 的收益就必然上升」。不过,它与 Agent 产品在真实工作中的一个常见问题相符:任务越长,模型之外的系统越容易影响最终结果。
一次性问答主要看模型能不能给出一个好答案。长程任务还要处理文件、工具、状态、报错和中间产物。
DeepSWE 使用 113 个未泄漏代码库,单个任务平均要修改 7 个文件、新增 668 行代码。AutomationBench 涉及 47 个 SaaS、近 500 个 API 端点,其中还混有陈旧数据。Agent 需要在多次调用之间保存状态,判断工具返回是否可信,发现错误后重新规划。
这种任务通常有两类麻烦。
一类来自用户,交付标准在任务开始时并没有被完整说出来。真实工作很少有完整标准答案。一个人说「把这些资料整理成一份能交付的报告」,未必会在第一句话里说清楚读者是谁、语气如何、哪些数据必须保留。很多标准要等中间结果出现后,才能逐渐确认。
另一类来自模型,模型自身的偏移,在长程任务里会被逐轮放大。每一步只偏一点,单独看都可能说得过去;后面的判断继续建立在这些结果上,偏差就会累积。跑到第 20 步时,系统仍在认真执行,但做出来的已经不是用户最初要的东西。
长程任务最难处理的情况,是每一步看起来都合理,最后的交付却不对。
Floatboat 把 Harness 的作用概括为「持续逼近交付标准」:在执行过程中保留目标,检查中间结果,必要时回退、追问或重做。
这也构成了他们对 Proactive Agent 的理解。定时唤醒只是触发方式;更难的部分,是在目标尚不完整时,通过执行和反馈,帮助用户逐步把标准弄清楚。
AOE Tech Labs 团队将其概括为:
「主动性的高级形态,不是替用户定时执行,而是帮助用户发现自己真正要什么,并把它做到。」
03
从文件到日志,
Harness 管的是 Agent 怎么干活
Harness 是一个容易被说得很玄的词。换成产品语言,它主要处理四件事。
第一,给 Agent 一个真正能工作的环境。
模型要修改代码仓库,就需要访问文件系统、运行进程,也需要清晰的权限和沙盒边界。只有一个对话框,很多任务从一开始就缺少执行条件。
第二,安排每一步怎么走。
模型完成一次调用后,系统要决定下一步是继续执行、检查结果、重新规划,还是回到前一步。Floatboat 将这部分称为 Agent Loop。一个有效的循环不能只让模型一直往前跑,还要在关键节点重新核对目标。
第三,把工具结果说清楚。
工具调用失败后,如果只返回一个空字符串,模型可能把它理解成「没有结果」,然后继续做出错误判断。工具的粒度、返回结构和错误信息,会直接影响后面的几十步。
第四,让团队看得见任务为什么失败。
任务在哪一步坏了?能不能从断点继续?同一类错误出现了多少次?这些问题依赖状态持久化、日志和可观测性。执行过程无法回看,团队就很难持续优化。
在这套架构中,FloatSail(Evolution System)解决的是时间维度和个性化的问题。随着模型不断更新、任务越来越复杂,它让 Runtime、Loop、Tools 以及模型适配策略,根据真实任务中的反馈持续演进。即使底座模型发生变化,系统已经积累的能力也能延续下来,不必随着每次模型更新重新开始。
AOE Tech Labs 团队将这套思路概括为:「技术上,只有自己完全可控的系统,才能驾驭高度不可控的模型,实现最大化模型的智能。」
这也是 AOE Tech Labs 过去几次产品的功能迭代的主线。
2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器放进 Agent 的工作环境;4 月,FloatIM 处理人与 Agent、Agent 与 Agent 之间的任务交接;5 月,FloatSchedule 让 Agent 按照日程自动开工。
文件读写依赖运行环境,任务交接依赖状态持久化,无人看管时完成任务则需要执行循环能够收敛。外界先看到的是产品形态,这次 Benchmark 想展示的是支撑这些产品的底层系统。
根据 AOE Tech Labs 提供的信息,创始人谭少卿拥有 10 年 OS 与 AI 创业经历以及亿级用户产品经验,两位技术合伙人分别具备模型训练和 OS 底层技术栈经验。这样的团队构成,也解释了他们为什么愿意投入更重的全栈路线。
这并不意味着所有 Agent 公司都要从 Runtime 开始自研。Benchmark 只能说明 Floatboat 的路线取得了一组积极结果,无法证明它是唯一选择。
对创业团队更实际的问题是:产品反复失败时,能否判断问题出在模型、工具、执行循环,还是运行环境;找到问题后,自己有没有能力改动对应的那一层。
04
HLR 帮你决定预算应该花在模型还是系统
Floatboat 还提出了一个新指标 HLR(Harness Leverage Ratio,Harness 杠杆率)。
它比较两段性能增量:一段来自同模型更换 Harness,另一段来自基线系统升级到一个更强参照系统。简化后的计算方式是:HLR = Harness 带来的分数增量 ÷ 参照系统相对基线的分数增量
分子是模型不动、只把 Harness 换掉,成绩涨了多少;分母是 Harness 不动、把模型升级到一个更强的参照系统,公开成绩涨了多少。价格只用来决定拿哪个模型当参照,不进入公式本身,分子分母都是同一项基准上的分数差。
HLR > 1 的含义很直接:只换 Harness 拿到的增量,已经超过升级到那个参照模型所代表的整段公开性能跨度。
以 DeepSWE 为例:
DeepSeek 官方系统:54.4;
Claude Opus 4.8 公开成绩:58.0;
Floatboat Harness + 同一个 DeepSeek 模型:67.25。
从 DeepSeek 官方系统到 Opus 4.8,分数差为 3.6;模型不变、接入 Floatboat Harness,分数增加 12.85。两者相除,HLR 为 3.57。
Floatboat 公布的五项结果为:

HLR 还不是行业标准,也不能精确拆出「纯模型能力」和「纯 Harness 能力」。它的数值会随着参照系统改变。Terminal Bench 就是一个例子:Opus 4.8 与 DeepSeek 官方 Harness 都是 82.7,没有产生可计算的升级跨度,因此 Floatboat 按预先声明的规则,改用最便宜的有效参照 GPT-5.6 Luna。
这个指标更有价值的地方,在于它提出了一个创业公司每天都会遇到的资源分配问题:效果不够好时,下一笔钱应该用来调用更贵的模型,还是用来补执行系统?
只看每百万 token 的单价,很难回答这个问题。团队还要计算任务完成率、总 token、重试次数、执行时间、人工接管和最终交付质量。
便宜模型如果需要重跑十次,未必真的便宜;高价模型如果卡在工具和环境上,也未必能完成任务。
05
每个 Agent 创业者都先做一套自己的任务集
Floatboat 这次公布的五项数据测量的是任务完成质量,不包含延迟、吞吐或总耗时。因此,它不能证明系统推理更快。
能够直接比较的是模型单位 token 的估算价格:$0.175/M 对 $10/M,约为后者的 1/57。真实任务成本还要取决于 token 消耗、重试和执行时间。
低单价的产品意义在于试错空间。长程任务很难一次跑对,用户会补充要求,系统也可能中途走偏。如果每次执行都要先判断「值不值得跑」,Agent 很容易停留在演示阶段;成本足够低,团队才敢把真实任务持续交给它。
为了把这次评测中的价格优势落到实际体验上,Floatboat 同步上线了基于 DeepSeek-V4-Flash 的新会员套餐,首月价格为 5 元 / 1 美元。用户拿到的正是本次 Benchmark 使用的底座模型,可以直接把自己的代码仓库、研究资料或跨应用任务放进去,观察同一个 DeepSeek 模型接入 Floatboat Harness 后的实际表现。
这个定价更像是给用户留出一段低成本试错期。任务跑偏了可以重来,要求发生变化也可以接着修改,不必在每次执行前先计算一次模型调用成本。对 Floatboat 来说,这也把「便宜模型 + 执行系统」的技术主张,变成了用户可以亲自验证的产品体验。
Floatboat 客户端还把文件管理器、编辑器和浏览器放在同一个环境中,并接入 3000 多个在线服务和多模态模型。这可以减少找文件、上传下载、切换应用和重复交代上下文。Floatboat 表示,完整客户端运行同一批基准的成绩高于当前公布的评测环境,但具体数据尚未披露,因此不能纳入本次结论。
对其他 Agent 创业公司来说,这份报告最可借鉴的部分,肯定不是照着 Floatboat 的技术栈重做一遍,而是设计一套自己的评测方式。
可以从一个很小的任务集开始:
选出 20 到 50 个最接近用户日常工作的任务;
固定同一个底座模型,比较不同 Harness 或产品配置;
记录完成率、人工接管、重试次数、总成本和交付质量;
找到失败最集中的环节,再决定预算投向模型、工具、执行循环还是运行环境。
短任务中,直接升级模型可能是更省事的方案;任务链条变长后,系统工程的重要性会上升。创业公司的技术投入,应该跟着真实失败的位置走,而不是跟着模型榜单走。
模型还会继续换代。对应用层公司来说,真正需要建立的是那些不会在下一次 API 升级后立即消失的能力。
模型决定 Agent 从哪里出发,执行系统决定它能不能把工作做到最后。
附:完整成绩总表

左侧为相对 Floatboat 的混合成本倍数(对数轴);右侧色深表示该列内的相对位置(列内独立归一化),斜纹格为未参评、非零分。青框为 Floatboat,红框为 Claude Opus 4.8。混合价 =(3 × 输入价 + 输出价)/ 4。
完整评测结果参照:
https://floatboat.ai/news/harness-benchmark


MiniMax 怎么做 Agent:Model-Harness 协同只是第一步,还有 Inference-Harness 协同
Manus 重新独立:这七个月一直没停下,但通用 Agent 的牌桌已经挤满了玩家
3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?
对话景鲲:AI 产品的 All in One,是上下文的 All in One
Alphaist 陈哲对谈蓝驰陈维广:AI 应用的机会在哪里?具身到底怎么投?
