四个AI Agent实时协作编程准确率近乎翻倍,超越单模型Claude Opus 4.8
Coral AI Labs联合多所大学发布AgentRadio异步通信框架,让多个AI Agent在执行编程任务时实时共享中间发现。在SWE-Atlas QnA基准测试中,四个Claude Code Agent借助AgentRadio达到62.1%准确率,超越单模型Opus 4.8的57.2%。
企业代码库越来越大,AI Agent在分析它们时经常力不从心——长周期任务需要多次交互和工具调用,单个Agent的上下文窗口很快就会撑爆。分给多个Agent似乎是自然解法,但现有方案有个致命缺陷:大多数多Agent系统不支持Agent在任务执行中实时协调。
Coral AI Labs和几所大学的研究人员提出了AgentRadio——一个异步消息传递层。它给Agent三个基本能力:创建线程、发送消息(不阻塞发送方)、等待被@(被动接收通知)。Agent可以在执行主任务的同时被动感知其他Agent的发现。
测试在SWE-Atlas QnA基准上进行,这个基准包含对真实生产代码库的长周期自然语言问题,不能光靠读代码解决,必须运行软件和执行命令。结果很有说服力:单个Claude Code(Opus 4.6)只解决了32.3%的任务,升级到Opus 4.8也只有57.2%。而四个Agent通过AgentRadio协调后,解决率飙升至62.1%。用DeepSeek V4 Pro做基础模型时,也从29.0%提升到50.8%。
一个具体案例说明了问题:在排查MinIO系统的任务中,Agent在执行过程中才发现需要检查服务端日志。没有异步通信时,两个Agent各自独立发现了这个需求但无法共享,最终团队一致给出了错误答案。有了AgentRadio,一个Agent瞬间将发现广播出去,其他Agent立刻吸收新证据,从失败变成了满分。
成本方面,API支出从单个Agent的2.96美元/任务上升到AgentRadio方案的19.45美元/任务。但如果是花同样多的钱跑六个独立的Opus实例,只解决了37.9%——远不如AgentRadio的62.1%。这说明性能提升来自架构设计,不是简单堆算力。
AgentRadio代码已在GitHub开源(Apache 2.0许可),可以插入现有的Claude Code或Codex CLI工作流,无需修改底层Agent框架。