YC重磅判断:AI下一轮胜负手不再是模型,而是Harness

日期:2026-09-21 15:26:44 / 人气:2


AI行业的竞争逻辑,正在发生一次根本性颠覆。
长期以来,行业默认的核心赛道只有一个:堆模型参数、刷模型基线、比拼底层智能上限。所有人都在追逐更强的大模型,坚信模型能力决定AI最终上限。但最新的实测数据与YC(硅谷顶级创投机构)的权威研判,彻底推翻了这一固有认知。
在ARC Prize推出的ARC-AGI-3人类极限推理测试中,一组反直觉数据震撼了整个AI圈:完全相同的模型GPT-6 Astra,仅更换外层运行框架Harness,推理得分从62.7%暴涨至98.6%,差值高达35.9个百分点。
更颠覆行业认知的是效率与成本的双向优化。成绩大幅跃升的同时,模型运行成本从2.61万美元降至1.73万美元,降幅达34%。大脑没有升级、模型没有迭代,仅仅更换了“工作方式”,同一个AI的能力、稳定性、性价比就实现质的飞跃。
基于这一颠覆性结果,YC专门举办Paper Club,抛出了重塑行业的核心观点:Why the Harness Matters More Than the Model。AI竞争的核心胜负手,已经从“谁的模型更强”,彻底转向“谁能更好地组织、调度、释放模型能力”。
模型能力已然成为行业通用“给定条件”,而剩余30%以上的能力差距、成本差距、落地差距,全部来自被长期忽视的Harness系统。
01、读懂Harness:模型是大脑,Harness是整套工作体系
Harness本义为“马具”,核心作用是承接马匹的原始力量,将其高效传导至车体。映射到AI领域,它是包裹在大模型之外,支撑模型完成真实复杂任务的全套运行框架与工程体系。
简单直白区分二者的核心价值:模型决定AI的大脑有多聪明,Harness决定这个聪明的大脑能不能真正干活、持续干活、高效干活。
我们日常关注的模型参数、训练数据、基座能力,只定义了AI的理论上限。而Harness涵盖的系统提示词体系、上下文调度规则、工具调用权限、记忆存储机制、子Agent分工逻辑、会话管理策略,决定了模型能否触达自身上限。
在过去的AI研发体系中,Harness相关优化长期被边缘化。调提示词、搭工具链、跑任务循环,被视作低端工程优化,而非核心AI研究。行业所有人扎堆攻坚模型预训练、对齐、参数迭代,却忽略了这套“外层框架”才是落地场景的核心瓶颈。
YC合伙人François Chaubard亲身验证了Harness的价值。他最初仅想为AI自动研究项目增加可视化界面,方便观测Agent运行状态,却在迭代中陆续接入资料检索、实验运行、成果评审、论文写作、进度管控等模块,无意中搭建出一套完整的Harness系统。
最终效果极具说服力:底层模型全程未做任何升级迭代,但依托持续优化的Harness框架,AI从只能产出粗糙初稿,进化为可自主承接研究选题、批量推进实验、输出高质量成果的智能体。这也印证了核心逻辑:模型定上限,Harness定落地率、定实战能力。
02、边界消融:Harness从工程优化,走向深度迭代闭环
早期Harness的核心价值是“补能力”,为原生模型补齐工具、记忆、流程短板。而当下,Harness已经进化为可自主迭代、反向优化模型的核心系统,模型与Harness的边界正在彻底打通。
行业迭代已经走完三个阶段,正向终极形态演进:
第一阶段,提示词工程智能化。过去依赖人工反复试错打磨提示词,效率低、稳定性差。如今DSPy等系统可自主遍历提示词写法,基于实测数据筛选最优方案,将传统“手艺式调参”转化为标准化搜索问题,大幅降低适配成本。
第二阶段,Harness框架自主重构。Darwin Gödel Machine(DGM)实现突破性升级,不再局限于微调配置,可直接改写Agent运行的底层代码、重构任务流程逻辑。在SWE-bench代码能力测试中,这套自主迭代的Harness系统,直接将模型得分从20%拉升至50%,实现能力翻倍。
第三阶段,经验沉淀闭环。Continual Harness架构实现了任务经验的永续复用,Agent可复盘历史任务数据、成败案例,自主优化提示词、新增技能、更新记忆、调整子Agent配置,让每一次运行数据都成为下一轮迭代的养分。
当下最激进的行业趋势,是Harness迭代开始反向赋能模型训练。Agent运行中产生的真实场景数据,可直接用于模型微调,甚至在测试阶段实时更新模型权重。至此,AI的进化逻辑彻底改写:不再是模型单向驱动落地,而是Harness迭代带动模型持续进化。
03、优秀Harness的核心:不固化流程,只调度资源与状态
随着大模型基座能力持续变强,行业传统Agent开发思路彻底过时。过去开发者习惯把任务流程层层拆解,固化每一步操作、每一次工具调用、每一个判断逻辑。这种模式稳定性尚可,但容错率极低,一旦任务周期变长、场景环境变化、出现突发状况,预设流程会直接失效。
Prime Intellect推出的Prime Agent,重构了Harness的设计逻辑:少固化流程,多储备资源,放权模型自主决策,核心是通过“信息分层存储”实现长效任务处理。
其将AI运行所需的所有信息分为三层,实现精细化调度:核心实时信息纳入当前上下文,保障即时决策效率;阶段性任务进度、代码成果、计算数据存入永续REPL运行环境,任务不中断、数据不丢失;长期记忆、专属技能、核心提示词外置存储,按需调取,无需冗余加载。同时子Agent完成任务后不销毁、不清空状态,可唤醒续接过往工作。
这套架构的价值,在超长周期复杂任务中体现得淋漓尽致。团队曾让Agent连续七天运行《异星工厂》复杂经营任务,全程调用633个子Agent,产出超2300万Token,完成24项核心技术研发,持续推进生产线搭建。过程中曾出现重大操作失误,技术进度大幅倒退,但Harness完整保留所有历史状态、资源数据与操作记录,模型可基于现状重新规划路径、接续推进,无需从零重启。
实测也再次验证行业核心真相:Harness无法凭空创造能力,只能极致放大模型固有能力。同一套优质Harness,搭配顶级模型与低端模型,得分差距仍高达70个百分点。模型是基础底盘,Harness是放大杠杆,二者缺一不可。
04、抹平代差:Harness让本地小模型追平云端大模型
Harness的革命性价值,在个人AI本地化落地场景中展现得最为直观。当前云端大模型能力强劲,但存在成本高、隐私泄露风险、延迟高等痛点;本地开源小模型隐私性强、成本极低,却与顶级云端模型存在6-12个月的能力代差。
斯坦福团队研发的OpenJarvis给出了全新解法:不用等待小模型迭代追平,依靠Harness系统优化,直接抹平大小模型的能力鸿沟。
团队做过一组对照实验:将云端顶级模型Claude Opus 4.6直接替换为本地小模型Qwen3.5-9B,完全保留原有系统配置,两项核心测试准确率分别暴跌24.8、38.8个百分点。而通过五层Harness系统重构优化(模型选型、运行机制、Agent逻辑、工具权限、持续学习体系)后,小模型追回56%、77%的性能损失。
最终落地结果极具颠覆性:优化后的本地AI系统,八项综合测试平均准确率达80.3%,仅比顶级云端模型的83.5%低3.2个百分点,其中四项测试成绩成功反超云端大模型。
更关键的是极致的性价比优势:优化后的本地方案,边际API成本仅为云端的1/800,端到端延迟缩短至云端的1/4。这证明个人AI本地化的核心瓶颈并非模型能力,而是缺乏一套成熟的Harness调度体系,通过外层架构优化,完全可以实现低成本、高隐私、高性能的本地AI落地。
05、企业级落地:Harness从能力调度,升级为运维与权限中枢
当AI Agent从工具走向企业规模化部署,Harness的核心使命再次升级。个人场景侧重能力与效率,企业场景则需要兼顾规模化运维、系统稳定性、数据安全与权限管控。
YC内部早在2025年初就开启了企业级Agent落地探索,从基础提示词、工具链、任务循环,逐步接入Slack办公、定时任务、虚拟机运行环境,让Agent具备自主编码、测试、迭代能力。但规模化部署50多个Agent后,传统架构的弊端彻底暴露:实例独立部署、运维分散,故障排查难度大、维护成本极高,无法统一管控。
为此YC自研企业级Harness系统QM,重构企业Agent运行架构:剥离Agent与单机的绑定关系,集中存储对话上下文、长期任务状态,将虚拟机、算力、工具接口转化为可灵活调度的公共资源,支持Agent按需切换运行环境与模型服务商,实现批量Agent的统一运维、统一管控、统一迭代。
同时,真实企业场景也暴露了Agent规模化的三大核心难题,均需依靠Harness体系解决:
第一,“主角综合征”。Agent容易局限于自身局部问题,提出影响全系统的修改方案,缺乏全局视角,需Harness建立人工把关与全局校验机制;
第二,任务过早放弃。Agent容易因多次小幅失败直接终止任务,为此Harness新增Grind Tool,设置最低运行时长与Token预算,杜绝无效终止;
第三,数据权限泄露。Agent可读取全域办公信息,却无法识别敏感数据边界,现阶段通过“只读为主、写入审批”的Harness权限机制规避风险。
这也意味着,企业AI落地的下半场,核心不再是堆模型能力,而是搭建一套可规模化、可管控、可迭代的企业级Harness治理体系。
结语:模型定速度,Harness定半径
过去两年,全球AI行业陷入模型内卷的同质化竞争,所有人都在追逐更强的基座、更高的参数、更好的基线成绩。但YC的系列研究与实测数据,彻底重塑了行业竞争逻辑。
模型依旧是AI发展的核心地基,没有优质模型,一切架构优化都是空谈。但在模型能力日趋同质化的当下,行业的核心差距,已经从地基高度,变成了地基之上的建筑水平。
模型决定AI能跑多快、智能上限有多高,而Harness决定AI能否适配复杂真实场景、能否长期稳定运行、能否低成本规模化落地、能否持续迭代进化。
AI的下一轮红利,不再属于只会堆模型的玩家,而是属于那些懂得搭建优质Harness、高效调度模型能力、打通落地闭环的架构玩家。

作者:耀世娱乐-耀世注册登录平台




现在致电 8888910 OR 查看更多联系方式 →

COPYRIGHT 耀世娱乐-耀世注册登录平台 版权所有