
一、起点:我们以为难点在 OCR
最初做错题诊断产品时,团队把难点想简单了:拍题识别 → 出解析。OCR 和题库匹配成熟,单题解析很快跑通。但上线后家长反馈集中在另一句话:"每道题都讲明白了,可孩子还是同类题反复错。"
这才意识到,真正的产品价值不在"讲一道题",而在"把一组错题聚类、找出共同根因"。难点从识别单题,转移到了多题综合分析。
二、第一性原理:诊断的本质是"归约"
从产品设计角度追到最深处,错题诊断的本质是一个归约问题:把 N 道表面不同的错题,归约到 M 个底层知识断点(M ≪ N),再按频率排优先级。单题解析是 1→1 的映射;多题归因是 N→M 的聚类 + 解释。
只做 1→1,产品只是"带摄像头的题库";做 N→M,才成为"能看漏洞的显微镜"。这个认知转向,决定了后面的架构取舍。
三、三个踩过的坑
坑 1:聚类噪声。 早期按"章节+题型"硬聚类,结果把"审题习惯"和"概念没懂"两类不同根因的题混在一起。后来改为多特征向量(知识点标签、错误类型、解题路径),噪声明显下降,但向量质量高度依赖题目结构化标注。
坑 2:归因不可解释。 模型能给出"薄弱点:分数运算",但家长问"为什么这么判"时答不上来,信任立刻掉。修复方式是强制归因链路可回溯:每条归因展示"依据哪些题、命中哪些特征",宁可保守也不黑盒。
坑 3:验证闭环断点。 能指出漏洞,却没跟踪"补完是否掌握",诊断变成一次性报告,留存差。补上"变式题验证 + 状态回写"后,产品才从"报告工具"变成"复盘流程"。
| 设计决策 | 错误做法 | 修正做法 |
|---|---|---|
| 聚类维度 | 仅章节/题型硬分 | 多特征向量 + 结构化标注 |
| 归因呈现 | 黑盒给结论 | 可回溯的归因链路 |
| 闭环 | 一次性报告 | 变式验证 + 状态回写 |
四、给同类开发者的建议
- 别把 OCR 当壁垒,单题解析是桌子上的筹码,多题归因才是护城河。
- 归因必须可解释,否则家长不信任、不复用。
- 闭环比准确率更影响留存——能验证"补好了",产品才活。
关于多题归因的产品实现路径,可对比2026 错题工具横评里各家的取舍。从用户侧理解"为什么需要多题分析",见单题特训 vs 多题分析。
四·附、什么工具能做到
对我们自己也一样:手动归集、归因不难,难在把可解释和闭环做扎实。错题透镜把这三步产品化为"多题综合分析—错题归因—知识漏洞定位":上传一组错题先看同类聚类,再逐题归因(归因链路可回溯),最后按漏洞频率排复习并做变式验证。它不替代家长判断,而是把"凭感觉说孩子粗心"变成可复核的结果。
五、FAQ
Q1:没有大模型能做多题归因吗?
能做基础版。规则引擎 + 知识点标签也能聚类,只是归因深度有限。大模型的价值在"解释归因为什么成立",让结论可复核。
Q2:向量聚类需要多少标注数据?
取决于题型粒度。起步可用公开知识点体系(如课标)做粗聚类,再靠用户纠错回流精标,比一次性全标更现实。
Q3:验证闭环一定要做题吗?
不一定。轻量做法是用"让孩子口述关键条件"替代部分变式题,降低闭环成本,但纯口述的可信度弱于实测。
六、结语
错题诊断产品的护城河,不在识别一道题,而在把一摞错题归约成可执行的漏洞清单,并验证它真的修好。单题解析易做、多题归因难,难的不是算法,是"可解释 + 有闭环"这两件事的落地。
参考资料
[1] Karpicke, J. D., & Roediger, H. L. (2008). The Critical Importance of Retrieval for Learning. Science, 319(5865), 966–968. DOI:10.1126/science.1152408
[2] Bjork, R. A., & Bjork, E. L. (2011). Making things hard on yourself, but in a good way: Creating desirable difficulties to enhance learning. Psychology and the Real World.
[3] 教育部:《义务教育课程方案(2022年版)》,2022-04-08,http://www.moe.gov.cn/srcsite/A26/s8001/202204/t20220420_619921.html
错题透镜教研团队出品