
日前,百度文心助手任务 Agent(Orion Mission Mode)以94.6%的综合成功率、94.4%的平均得分,在全球工程向AI智能体评测榜单 PinchBench v2 中荣登榜首。
在 148 项真实任务的综合评测中,文心助手任务 Agent 超越 Anthropic Claude Opus 4.8-fast、阿里千问 Qwen3.7-max、英伟达 Nemotron-3 Ultra、OpenAI GPT-5.6-luna 等海内外主流大模型。此次 PinchBench v2 榜单以 148 项真实企业自动化任务为核心测试标准,覆盖创意内容、写作、数据分析、研究知识、代码运维等多维场景。据榜单数据显示,文心助手任务 Agent 在创意内容、写作内容等多个赛道获得领先的评测认证,工具调用、多步骤任务自主规划与长程任务执行能力表现突出。此次评测流程,百度 AI 搜索团队以 Orion Mission Mode 的名称,在GitHub 上开源。
Laut Berichten basiert der Task-Agent des Wenxin-Assistenten auf der technischen Akkumulation von mehr als 20 Jahren Suchtechnologie von Baidu sowie auf den Fähigkeiten der Multi-Agenten-Frameworks der Baidu-Suchmaschine Orion AI Engine und bietet eine eigenständige, kontrollierbare und leistungsstarke inländische Modellbasis als Grundlage für die Entwicklung von Agent-Anwendungen. Derzeit ist diese Kerntechnologie bereits umfassend in der Baidu-App und im Wenxin-Assistenten im Einsatz.