同一问题,两种研究:通用 Deep Research vs EduEvidence

问题:大一 C 语言课程是否应该允许学生使用生成式 AI 编程助手? 左列是通用 deep-research 类工具的典型产出形态;右列是 EduEvidence 旗舰示例 examples/ai-coding-assistant-evidence/ 的实际产出。所有差异点都以 本仓库可复核的工件为准(以实测为准,不引用未核验的第三方评测)。

维度通用 Deep Research(典型形态)EduEvidence(本仓库实测行为)
引用真实性 模型生成参考文献,幻觉/错配无法被使用者当场发现;官方文档亦承认存在事实性幻觉。 每条来源带注册表核验徽章:8/8 DOI 通过 Crossref/DataCite 存在性 + 标题匹配 (citation_check.json 留痕)。DOI ✓ ×8
证据与结论的关系 叙述式总结,"任务提速"与"学习提升"常被混写为一句乐观结论。 强制 Outcome Separation:任务表现(+48%/+55%)与独立考试成绩(无护栏 −17%) 分列不同 outcome,规则禁止把前者当后者(task≠learning 铁律入 gate)。
置信度 无量化置信度,或输出不可复算的"信心表述"。 确定性公式可复算:Moderate / 0.586 / policy 2026-08-12.v3, 分解项(质量/一致性/直接性/数量/罚分)逐项可审计;同一策略下 间隔重复案例 给出 ADOPT / High / 0.893,四态出口都被实跑过。
决策可用性 给"综述",不给"能不能上"的决定与止损条件。 裁决由确定性策略给出,不是人写死的:本例 PILOT(限制性四阶段渐退试点),附 stop conditions 与 no-AI 迁移评估设计;间隔重复案例为 ADOPT(可直接采用)。ADOPT 需同时满足高把握度与主要结果上的直接证据,两条路径都有公开案例。
事后失效 文献被撤稿后报告静默过期。 scripts/retraction_watch.py 持续监控已引 DOI,撤稿即出 diff 报告; 已知撤稿元分析(Wang & Fan 2025)作为内置演示场景。

现场小实验:引用列表能被逐条点开验证吗?

旗舰示例的 8 条来源全部给出注册表可解析的 DOI——随机点开任意一条即可核对标题:

  1. Bastani et al. 2025, PNAS — 10.1073/pnas.2422633122DOI ✓
  2. Kazemitabaar et al. 2023, CHI — 10.1145/3544548.3580919DOI ✓
  3. Peng et al. 2023 (preprint) — 10.48550/arXiv.2302.06590DOI ✓
  4. Yetistiren et al. 2023, JSS — 10.1016/j.jss.2023.111734DOI ✓
  5. Finnie-Ansley et al. 2022, ICER — 10.1145/3545945.3569830DOI ✓
  6. 解释对比研究 2023, Koli Calling — 10.1145/3587102.3588785DOI ✓
  7. Vaithilingam et al. 2022, UIST — 10.1145/3491101.3519665DOI ✓
  8. Marzuki et al. 2024, Smart Learning Env. — 10.1186/s40561-024-00295-9DOI ✓

作为对照:一个"编造但看起来合理"的引用长这样 —— Bastani et al., PNAS 2025, 10.1073/pnas.2412345122 404 Not Found (这正是 v5.1 及之前旗舰示例里真实存在过的伪造 DOI, 已在 v5.2.0 全量审计中清除;审计方法与完整清单见 benchmarks/doi-audit/report.md。)

边界声明:EduEvidence 不声称比通用工具"更聪明"。它做的是把可验证性、 结果分离与决策纪律做成流水线强制项。确定性层完全可复现;LLM 层的复现边界 见 docs/reproducibility.md。合成演示包一律带 SYNTHETIC 徽章。

← 返回项目主页 · GitHub 源码 ↗