问题:大一 C 语言课程是否应该允许学生使用生成式 AI 编程助手?
左列是通用 deep-research 类工具的典型产出形态;右列是 EduEvidence 旗舰示例
examples/ai-coding-assistant-evidence/ 的实际产出。所有差异点都以
本仓库可复核的工件为准(以实测为准,不引用未核验的第三方评测)。
| 维度 | 通用 Deep Research(典型形态) | EduEvidence(本仓库实测行为) |
|---|---|---|
| 引用真实性 | 模型生成参考文献,幻觉/错配无法被使用者当场发现;官方文档亦承认存在事实性幻觉。 | 每条来源带注册表核验徽章:8/8 DOI 通过 Crossref/DataCite 存在性 + 标题匹配
(citation_check.json 留痕)。DOI ✓ ×8 |
| 证据与结论的关系 | 叙述式总结,"任务提速"与"学习提升"常被混写为一句乐观结论。 | 强制 Outcome Separation:任务表现(+48%/+55%)与独立考试成绩(无护栏 −17%) 分列不同 outcome,规则禁止把前者当后者(task≠learning 铁律入 gate)。 |
| 置信度 | 无量化置信度,或输出不可复算的"信心表述"。 | 确定性公式可复算:Moderate / 0.586 / policy 2026-08-12.v3, 分解项(质量/一致性/直接性/数量/罚分)逐项可审计;同一策略下 间隔重复案例 给出 ADOPT / High / 0.893,四态出口都被实跑过。 |
| 决策可用性 | 给"综述",不给"能不能上"的决定与止损条件。 | 裁决由确定性策略给出,不是人写死的:本例 PILOT(限制性四阶段渐退试点),附 stop conditions 与 no-AI 迁移评估设计;间隔重复案例为 ADOPT(可直接采用)。ADOPT 需同时满足高把握度与主要结果上的直接证据,两条路径都有公开案例。 |
| 事后失效 | 文献被撤稿后报告静默过期。 | scripts/retraction_watch.py 持续监控已引 DOI,撤稿即出 diff 报告;
已知撤稿元分析(Wang & Fan 2025)作为内置演示场景。 |
旗舰示例的 8 条来源全部给出注册表可解析的 DOI——随机点开任意一条即可核对标题:
作为对照:一个"编造但看起来合理"的引用长这样 ——
Bastani et al., PNAS 2025, 10.1073/pnas.2412345122
404 Not Found (这正是 v5.1 及之前旗舰示例里真实存在过的伪造 DOI,
已在 v5.2.0 全量审计中清除;审计方法与完整清单见
benchmarks/doi-audit/report.md。)
docs/reproducibility.md。合成演示包一律带 SYNTHETIC 徽章。