上下文用量用于展示当前会话已占用的上下文容量。当会话内容接近模型上下文上限时,您可以通过压缩上下文释放可用空间,降低因上下文超限导致任务中断的概率。
本文介绍如何查看 ArkClaw 的上下文用量及其构成、执行上下文压缩,以及处理压缩失败或切换模型后上下文超限等情况。
上下文(Context)指当前会话中 AI 能看到和参考的所有内容,包括用户发送的消息、ArkClaw 的回复、上传或引用的文件和代码片段、系统提示词(System Prompt)、工具调用记录和子智能体的输出等。这些内容共同构成 AI 回答时的视野范围。
推理模型每次处理信息都有最大容量限制,并以 Token 为单位计量。当前会话内容超过上下文窗口后,模型将无法继续处理新的消息。您可以查看上下文用量,并通过压缩上下文或新建会话释放可用空间。
- 不同推理模型的上下文窗口可能不同,因此同一会话在切换模型后,上下文用量比例可能发生变化。
- 上下文压缩不会还原为完整历史原文。压缩后,较早内容会以摘要形式保留。
- 如果单次输入内容过长,例如一次性粘贴超长文档、多张图片或大量工具返回结果,仍可能触发上下文超限提示。建议拆分内容后分批发送。
- 打开浏览器,在浏览器地址栏中输入登录 ArkClaw 链接,按“回车”键。
-
-
- 在 ArkClaw 输入框中,将鼠标悬停在
图标上,查看当前会话的上下文用量详情。
- 上下文用量详情会按来源拆分 Token 消耗。常见分类如下表所示。
-
ArkClaw 会根据上下文用量展示不同状态,帮助您判断当前会话是否需要处理。低用量阶段通常不需要操作;当用量接近上限时,界面会通过图标和提示信息提醒您关注当前会话状态;达到阈值后,可以手动压缩上下文。
-
:上下文用量处于较低水平,正常继续对话。
-
:表示当前上下文用量已接近上限。您可以将鼠标悬停在
图标上,在弹出的对话框中,单击“压缩上下文”按钮进行手动压缩。如果当前会话内容过多,也可以新建会话继续处理,避免因上下文超限导致任务中断。
说明
当上下文窗口剩余可用容量不足 20K token 时,系统将自动触发上下文压缩策略,精简历史对话内容,保障后续多轮交互正常执行。
-
压缩完成后,会话页面会显示完成上下文压缩,并展示本次压缩前后的 Token 用量。单击“压缩摘要”按钮,可以展开查看本次被摘要化的历史内容,包括用户要求、核心关注点、AI 已提供的处理内容,以及与任务相关的修改意见等。
如果压缩未成功,对话框界面会弹出“上下文压缩失败”提示框。您可以单击“重试压缩”按钮,重新压缩。如果重试后仍无法继续,建议单击“新建会话”按钮,将后续任务拆到新的会话中处理。对于超长文档、多图或大量工具返回结果,建议先拆分输入内容,再继续发送。
切换模型时,ArkClaw 会根据目标模型的上下文容量重新判断当前会话是否还能容纳已有内容。 - 如果系统判断当前已用内容超出了目标模型总容量,会在模型列表中对应模型名称右侧显示“切换后将超限”提示,帮助您在切换前感知风险。
-
- 如果继续选择该模型,系统会弹出“切换模型后上下文将超限”的提示。弹窗会提示您先处理当前上下文,您可以执行以下操作:
- 单击“取消”按钮,放弃本次模型切换,并继续使用当前模型。
- 单击“压缩并切换”按钮,系统会先压缩上下文,再切换到目标模型。
-
压缩不会直接删除所有历史。系统会将较早对话整理为摘要,并保留最近的原始消息。您可以单击“压缩摘要”按钮,展开查看本次生成的摘要内容。
为什么我看到的总 Token 上限不是固定值?
不同模型的上下文窗口可能不同,因此“上下文用量”中的总 Token 上限会随当前模型变化。
当上下文用量达到 90% 以上时,界面会提供“压缩上下文”入口。您可以手动单击该入口进行压缩。
查看“完成上下文压缩”提示中的释放 Token 数量和占用变化。如果占用从高位下降,例如由 91% 降至 20%,说明本次压缩已释放可用上下文空间。
如果目标模型的上下文容量小于当前已用内容,直接切换可能导致当前会话超限。选择“压缩并切换”后,系统会先释放上下文空间,再完成切换。