You need to enable JavaScript to run this app.
文档中心
ArkClaw 企业版

ArkClaw 企业版

复制全文
下载 pdf
ArkClaw性能说明
ArkClaw记忆能力性能说明
复制全文
下载 pdf
ArkClaw记忆能力性能说明
本文将通过验证LanceDB与ArkClaw在真实业务场景中的兼容性、性能与能力提升效果,介绍ArkClaw的记忆能力LanceDB的性能。
背景介绍
ArkClaw记忆能力
ArkClaw记忆能力是一套赋予企业级AI智能体自我学习与进化能力的火山自研Context Engine引擎。它告别了传统AI “一次一忘”的局限,通过构建持续演进的“记忆、技能、经验”三维画像,让智能体在与您的协作中不断成长,实现更准、更稳、更省、持续自我提升的任务执行效果。当前通过LoCoMo测试,任务成功率提升338%,Token消耗减少64.7%。详细数据请参见测试结果
LoCoMo
LoCoMo(Long-Term Conversational Benchmark)是一个专门用来评测大语言模型和智能Agent“长期对话记忆能力”的公开评测集。模拟真实人类的长期交往,检验Agent是否能像人一样,基于角色(Persona)和生活事件(Event)进行有记忆的对话,用来比较不同记忆机制在长期、多session对话场景下对准确率、事实一致性、时间/因果推理以及多模态理解能力的影响。
评测范围与能力要求
本次测试围绕网页浏览、检索及复杂推理等关键业务路径开展,基于LoCoMo公开评测集构建统一评测框架,通过对比接入LanceDB前后ArkClaw的能力表现,重点监测接入LanceDB模块后,ArkClaw在准确率、时延及成本三大核心维度的综合变化,全面评估ArkClaw核心业务能力的优化效果,确保测试结果的客观性、可复现性与业务参考价值。为后续方案选型、资源投放及灰度上线等决策提供数据支撑与理论依据。
LoCoMo评测体系包含数据写入(Ingest)、问题问答(QA)和结果判定(Judge)三个核心步骤,聚焦对大语言模型与记忆增强型Agent的长期对话能力评估。在超长对话上下文场景下,重点考察其对事实、时间序及多模态信息的理解与回忆。标准版LoCoMo的评测维度与场景如下表所示:
评测维度
场景/任务类型
LoCoMo数据规模与结构特征
核心评估目标
核心能力要求
长期对话记忆
多Session长对话(双 Agent对话)
包含约10段极长对话,每段平均约300轮、约9K tokens,跨最多35个会话,会话以人物设定与时间事件图为约束生成,并经过人工校对。
在极长、多轮对话中保持角色一致与事实一致,能在后续轮次中正确引用和更新历史信息。
长期对话上下文建模、跨Session的事实记忆与更新、角色与时间线一致性维护。
问答与推理
长上下文问答(QA)
基于对话构造1540个多类型问题,并给出标准答案与含答案证据片段的标注,用于度量不同模型在长上下文下的回答质量。
检验模型能否在极长历史中定位相关片段,完成单跳、多跳、时间、常识与对抗性等不同类型推理问答。
长上下文检索与聚合、跨多轮的多跳推理、时间与因果关系理解、对抗性问题鲁棒性。
事件级理解
事件图总结(Event Graph Summarization)
每段对话配有针对双方角色的事件列表与因果、时间关系标注,作为事件总结任务的“事件图真值”。
评估模型是否能在长对话中抽取关键事件,并重建合理的时间顺序和因果链。
关键事件抽取、时间序列与因果结构建模、基于对话的高层语义压缩与总结。
多模态对话
文本和图像的多模态对话生成
对话中可包含图像分享与图像反应信息,部分LoCoMo扩展版还提供基于图像的视觉问答子任务,用于考察视觉记忆与对话一致性。
在利用历史文本与图像信息的前提下,生成语义连贯、上下文一致且对视觉内容敏感的回复。
多模态对话建模、视觉信息记忆与检索、图文对齐与视觉推理。
测试模型
  • embedding模型:doubao-embedding-vision-251215、基础Embedding模型。
  • 大模型:doubao-seed-2-0-pro-260215
说明
本文详细测试流程,请参见LoCoMo评测流程。您也可以根据文档进行测试。
测试结果
准确率
本次准确率测试覆盖LoCoMo数据集1540道测试题目,通过对比接入LanceDB前后ArkClaw的准确率表现,明确向量检索模块对系统任务完成质量的提升作用,具体数据如下表所示:
无LanceDB准确率
有LanceDB准确率
提升幅度
样本数 / 备注
13.6%
59.68%
338%
1540
提升幅度=(有LanceDB准确率-无LanceDB准确率)/无LanceDB准确率*100%
embedding模型
模型类型
有LanceDB准确率
doubao-embedding-vision-251215
59.68%
基础Embedding模型
39.87%
Token成本
Token成本是系统部署与运营的核心成本指标,本次测试重点统计接入LanceDB前后ArkClaw的Token调用量,评估LanceDB对系统成本的优化效果,具体数据如下表所示:
无LanceDB调用Tokens
有LanceDB调用Tokens
降幅 / 成本降低
20958679
7399781
成本降低64.7%
降幅=(有LanceDB调用Tokens-无LanceDB调用Tokens)/无LanceDB调用Tokens * 100%
embedding模型(有LanceDB调用Tokens)
模型类型
总量
输入
输出
doubao-embedding-vision-251215
33155331
7399781
1163786
基础Embedding模型
58684765
40260296
1076335
结论
1540个测试题目中,接入LanceDB后,带来了显著的准确性、性能和成本优化。
效果提升
  • 总体准确率:从13.6%提升至59.68%,整体提升338%
成本与效率
  • 成本Token:LoCoMo评测下,LanceDB将输入Token成本降低64.7%。
最近更新时间:2026.04.27 14:19:14
这个页面对您有帮助吗?
有用
有用
无用
无用