Evidence notes
证据与验证边界
这些记录用于回查导览内容,不会把 Mock、Fixture 或 development 案例扩大解读为 Live 质量结论。
01
本页数据来源
- 场景 A
scripts/generate_demo_trace.py驱动真实本地 Workflow(Mock LLM、fixture embedder、Mock 企业 Adapter、SQLite + 官方 AsyncSqliteSaver)跑完 10 步并冻结视图模型。- 场景 B
reports/verification/v0.4/20260906-remediation/development/中历史 DeepSeek 候选配置的脱敏探针证据;每次运行的 request ID、工具返回与逐值校验结果均在证据文件中。- 当前推荐 Live target
- GPT-5.6 Sol 在同一冻结 V2 holdout 完成 60/60,自动通过 55/60;严格人工盲评 10/10 达线、平均 0.98。该结果来自 Codex/ChatGPT 订阅通道,不等同于 OpenAI API 或企业数据验证。
- 契约拦停
- 同一冲突案例的另一次运行被因果契约两次拒绝后终止(
schema_validation_failed),无答案流出。
02
不能从本页得出的结论
- Mock LLM / Mock Adapter 的运行不证明真实模型质量或真实企业系统兼容性。
- 场景 B 展示的是历史 DeepSeek development 案例;对应 DeepSeek 冻结 Live 卡保持 failed。当前推荐的 GPT-5.6 Sol Live 卡已通过,但其输出未纳入本页。
- deepseek-v4-pro 尚未核价,探针 Token 用量见修复记录,不估算美元成本。
03