ArkClaw 企业版
评测维度 | 场景/任务类型 | LoCoMo数据规模与结构特征 | 核心评估目标 | 核心能力要求 |
长期对话记忆 | 多Session长对话(双 Agent对话) | 包含约10段极长对话,每段平均约300轮、约9K tokens,跨最多35个会话,会话以人物设定与时间事件图为约束生成,并经过人工校对。 | 在极长、多轮对话中保持角色一致与事实一致,能在后续轮次中正确引用和更新历史信息。 | 长期对话上下文建模、跨Session的事实记忆与更新、角色与时间线一致性维护。 |
问答与推理 | 长上下文问答(QA) | 基于对话构造1540个多类型问题,并给出标准答案与含答案证据片段的标注,用于度量不同模型在长上下文下的回答质量。 | 检验模型能否在极长历史中定位相关片段,完成单跳、多跳、时间、常识与对抗性等不同类型推理问答。 | 长上下文检索与聚合、跨多轮的多跳推理、时间与因果关系理解、对抗性问题鲁棒性。 |
事件级理解 | 事件图总结(Event Graph Summarization) | 每段对话配有针对双方角色的事件列表与因果、时间关系标注,作为事件总结任务的“事件图真值”。 | 评估模型是否能在长对话中抽取关键事件,并重建合理的时间顺序和因果链。 | 关键事件抽取、时间序列与因果结构建模、基于对话的高层语义压缩与总结。 |
多模态对话 | 文本和图像的多模态对话生成 | 对话中可包含图像分享与图像反应信息,部分LoCoMo扩展版还提供基于图像的视觉问答子任务,用于考察视觉记忆与对话一致性。 | 在利用历史文本与图像信息的前提下,生成语义连贯、上下文一致且对视觉内容敏感的回复。 | 多模态对话建模、视觉信息记忆与检索、图文对齐与视觉推理。 |
无LanceDB准确率 | 有LanceDB准确率 | 提升幅度 | 样本数 / 备注 |
13.6% | 59.68% | 338% | 共1540题 |
模型类型 | 有LanceDB准确率 |
doubao-embedding-vision-251215 | 59.68% |
基础Embedding模型 | 39.87% |
无LanceDB调用Tokens | 有LanceDB调用Tokens | 降幅 / 成本降低 |
20958679 | 7399781 | 成本降低64.7% |
模型类型 | 总量 | 输入 | 输出 |
doubao-embedding-vision-251215 | 33155331 | 7399781 | 1163786 |
基础Embedding模型 | 58684765 | 40260296 | 1076335 |