星空人工智能技术网

AgentOmnia:面向全场景能力扩展的Agent大模型后训练技术实践

近日,华为云大模型后训练团队发布技术报告《AgentOmnia: Scaling Agentic Models for Full-Scenario Applications》,提出面向全场景应用的Agent大模型后训练体系AgentOmnia,探索如何推动Agent从“在专项测试中表现优秀”进一步确保“能够适应不同用户、业务系统和复杂任务”,从而提升其面向多类真实应用场景的通用能力。

大语言模型驱动的Agent正从工具调用走向与用户和复杂环境的持续交互。然而,现有训练与评测通常围绕有限的领域或平台展开。模型在单项benchmark上取得高分,并不代表它能够稳定处理企业软件、消费者服务、办公文档、数据分析和复杂规划等不同任务。

针对这一问题,华为云大模型后训练团队提出AgentOmnia,探索Full-Scenario Agentic Scaling,即如何通过统一的任务空间,衔接数据构造、模型后训练、评测诊断与持续迭代,系统扩展Agent大模型的全场景能力。

以Qwen3-30B-A3B-Thinking-2507为基础模型进行Agentic后训练,AgentOmnia-30B-A3B在全场景测评基准OmniaBench挑战集上的任务通过率由9.16%提升至37.11%,提升覆盖 76/90 个L1 domain及全部capability和atomic difficulty维度。此外,AgentOmnia在OmniaBench、τ²-Bench、DeepPlanning和VitaBench四项基准的宏平均由22.86%提升至41.69%,综合得分超过多项同类型前沿工作。

999.jpg

AgentOmnia整体评测结果。 以Qwen3-30B-A3B-Thinking-2507为基础模型,展示AgentOmnia在四项基准宏平均、跨基准表现,以及领域、能力和原子难度维度上的提升。

AgentOmnia以全场景分类体系定义任务空间,以环境、任务和轨迹合成构建训练数据,再通过SFT与在线Agentic RL提升模型能力。评测结果和外部需求还可以进一步转化为PRD,指导下一轮针对性数据构造。

AgentOmnia全场景Agent大模型后训练体系。 全场景分类体系定义并度量任务空间,数据合成模块构建可执行环境、任务与可靠轨迹,SFT和在线Agentic RL将其转化为模型能力,评测诊断与PRD则进一步指导后续数据合成和模型迭代。

用统一坐标描述全场景能力