美团发布面向复杂问题的大模型智能体评测基准——VitaBench

AI 资讯快报 • 2026-10-21 00:0011次浏览

美团 LongCat 团队发布，是面向复杂问题的大模型智能体评测基准。以外卖点餐、餐厅就餐、旅游出行三大生活场景为载体，构建了包含 66 个工具的交互式评测环境。VitaBench 从深度推理、工具使用与用户交互三大维度量化任务复杂性，通过真实用户模拟器和原子化评估准则实现细粒度评估。更多详情...