美团发布面向复杂问题的大模型智能体评测基准——VitaBench

AI 资讯快报  • 2026-10-21 00:001次浏览
美团 LongCat 团队发布 ,是面向复杂问题的大模型智能体评测基准。以外卖点餐、餐厅就餐、旅游出行三大生活场景为载体,构建了包含 66 个工具的交互式评测环境。VitaBench 从深度推理、工具使用与用户交互三大维度量化任务复杂性,通过真实用户模拟器和原子化评估准则实现细粒度评估。 更多详情...