检测项目一览 / 上下文完整性
上下文完整性检测
中转站检测:在约 8000 token 的长文本开头埋入校验码,测试模型能否准确读回,用于发现宣称的大上下文被暗中截断。三种协议均适用。
测什么
在一段约 8000 token(约 2 万字)的长 prompt 开头埋入一个随机校验码,中间用大段中性填充文本把校验码推离结尾,要求模型在结尾只原样输出这个校验码,检查它能不能准确读回。
为什么能判真假 / 来路
中转站为了省成本,有时会把宣称支持的大上下文(比如 200K、1M)暗中截断到远低于宣称的量级。把一个「针」埋在长文本开头、要求模型在结尾准确捞出来,能测出这条通道在这个文本量级上是否还保留着完整的上下文——校验码读不回来,说明上下文可能在这个量级就已经被截断了。
结果怎么读
- 通过:约 8000 token 长文开头埋入的校验码被正确读回,说明这一量级的上下文没有被截断。
- 存疑:约 8000 token 长文开头的校验码没能读回——可能是上下文被截断到了这个量级以下,也可能只是模型没有遵循单轮指令(这项判定本身噪声较大)。
- 未通过:这个探针不会给出「未通过」,只有通过/存疑/信息不足三档。
- 信息不足:没有取得可读的回答,或请求失败。
局限:它判不了什么
本站只测到约 8000 token(约 2 万字)这一个量级——读回成功只能说明「这个量级没被截断」,不能证明中转站宣称的 200K、1M 等更大上下文真的完整可用,那需要更长的测试文本,本站目前没有做。判定刻意保守,读不回来只判「存疑」、从不判「未通过」,因为「没读回」既可能是真被截断,也可能只是模型没听清指令。
自己怎么验
这项测试需要构造一段约 2 万字的长文本再嵌入校验码,一条命令行不下,建议直接用首页的检测工具跑这一项。
去首页填入你的接口地址、Key 和模型名,点开始检测,工具会自动生成填充文本、嵌入校验码并比对结果。
相关检测项
常见问题
为什么要测上下文完整性?
如果一条通道把宣称的大上下文窗口暗中砍小,你以为能塞 20 万 token 进去,实际上几千 token 之后的内容模型可能就看不到了。这项检测用来发现这类截断——不过它只测到约 8000 token 这一个量级。
只测 8000 token 够吗?
只能测出「这个量级没被截断」,测不出更大声称(比如 200K、1M)的上下文是否完整可用。这是本站目前的覆盖上限,如实告知,不夸大结论。