变体稳定性矩阵
10 算法 × 3 变体
矩阵为 10 算法 × 3 变体(共 30 段合成样本)。每个单元格是该变体在「中性 prompt」下的判定;同行三格同色即代表「换写法不改盲点」(变体稳定性)。鼠标悬停查看幻觉类与说明。变异体分析测的是检测器稳定性,不是盲点扩展。
clean(无确认缺陷)
major(结果错 / 不可用)
critical(密钥泄露 / 认证绕过)
重新拉取远程数据
Seed corpus notice. The 30 samples on this page are an AI-generated seed corpus (synthetic), produced to exercise the detector pipeline and classification rubric. They are not an empirical measurement of any AI system's error distribution. A real measurement requires independently generated samples across multiple models.
种子语料声明。 本页 30 个样本均为 AI 生成的合成种子语料(synthetic),用于验证检测器流水线及分类准则,并非对任何 AI 系统错误分布的实证测量。真实测量需要跨多个模型独立生成样本。
种子语料声明。 本页 30 个样本均为 AI 生成的合成种子语料(synthetic),用于验证检测器流水线及分类准则,并非对任何 AI 系统错误分布的实证测量。真实测量需要跨多个模型独立生成样本。
范围与局限。 全部 30 个样本为合成种子语料,由本沙箱唯一可用的 AI 来源生成(无 GPT/Gemini 密钥或出网)。
因此本图度量的是 该 AI 的系统性盲点分布,不代表跨 AI 普适性。跨 AI 共识盲点待 `scripts/pilotB_run_gpt.py`(需密钥 + 出网)启用后补充。
数据 Apache-2.0 公开;标注为人工审查(class 10 数学错误仅人工标定,不自动检测)。变体(v1/v2/v3)为三个中性 prompt 措辞,用于检验「同算法换写法后缺陷是否稳定出现」。
FIBEMATE · Blind-Spot Map · 单文件零依赖 · 康定斯基构成主义视觉语言(公有领域)