日志

AI 批改如何为一个课程班次节省 70% 时间

一个匿名案例研究:一家在线课程公司用基于评分标准的 AI 批改,把每个班次的批改时间缩短了 70%,讲师质量 NPS 保持稳定。

omar f.applied ai & data··1 分钟阅读

这篇文章讲的是什么. 一个匿名化的结果:一家运营 4 个月制直播班次的在线教育公司,把每个班次的批改时间缩短了 70%。AI 按照客户自己的评分标准给每份作业打分,需要判断力的情况仍由人来处理。

这里的客户是一家在线课程公司的学习负责人。班次是 4 个月制的直播课,每一份作业都靠人工批改。这项工作吃掉大量讲师工时,而讲师工时是班次成本里最大的一项。利润就是这样一份作业一份作业地漏掉的。

他们担心的是质量。把一个工具扔进这堆作业里,批改是快了,但也变差了——讲师们把这话说得很直白。所以我们没有取代他们,而是交付了一个 LMS 扩展,按讲师自己的评分标准给作业打分,并把每一个分数都展示在一个抽样审核仪表盘里。

#AI 批改能在不牺牲质量的前提下降低在线课程的成本吗?

在线课程用 AI 批改能不能既降低成本又不损害质量?

在这个项目里,答案是可以。一家在线课程公司用 AI 按自己的评分标准给作业打分,再把处于边界的那 15% 升级给讲师处理,把每个班次的批改时间缩短了 70%,讲师质量 NPS 保持稳定。评分标准始终是客户自己的,每一个模棱两可的判断仍然由人来定。

质量之所以没有下滑,原因在这里:评分标准始终是客户自己的,AI 把它一致地套用在那 85% 一目了然的作业上,把处于边界的情况升级给人处理。于是讲师把工时花在真正需要判断力的那 15% 上,而不是整堆作业上。

#这 70% 究竟是从哪里省出来的?

不是靠每一份作业都批改得更快,而是靠人工批改的份数变少了。这些班次里大约 85% 的作业,按评分标准来看要么明显合格要么明显不合格,这些由 AI 打分。剩下那 15% 落在评分标准边界附近的作业,会连同对应的评分标准条目和学生作业一起交给讲师,逐条对照处理。

  • LMS 扩展读取每一份作业,并对照客户现有的评分标准打分
  • 一个置信度阈值把作业分成两堆:明确的直接打分,边界情况升级处理
  • 一个抽样审核仪表盘让讲师可以调出任意一批作业,覆盖任意一个分数
  • 每一个分数都能追溯到它对应的评分标准条目

讲师怎么知道这些分数是对的?

他们靠审核。每一批作业都会出现在一个仪表盘里,讲师可以抽样,把 AI 的分数和评分标准放在一起对照阅读,并加以覆盖。这就是讲师质量 NPS 保持稳定的原因:担心质量下滑的那些人,正是在检查这些工作的人。

we are

我们交付一个按你的评分标准打分的 LMS 扩展,并给讲师一个可以审核和覆盖的仪表盘,而且我们会把数字说清楚:每个班次批改时间减少 70%。

we aren't

我们不是那种用自己的标准取代你的标准、把整堆作业不加审阅就批完的通用批改机器人。

这个项目属于我们的平台业务:跑在你产品内部的软件。评分标准的设计和人工介入策略则来自咨询业务。我们不会交付一个模型就走人,而是把扩展、仪表盘和升级规则一起交付。

客户要求暂不具名。数字是真实的,项目也是真实的。我们发布结果并附上一份凭证,因为没有凭证的案例研究只是一句宣称。更多这样的案例收录在日志里。

AI 批改那些显而易见的,讲师留下那些真正棘手的。

omar f.,应用 AI 与数据

如果你也在运营班次、批改正在吃掉你的利润,上面这套模式是可以复制的:同样的评分标准,同样的讲师,明显作业上花的工时更少。告诉我们你在构建什么,我们会告诉你,在你的课程里这 70% 会从哪里省出来。

返回日志
build in publiceducationautomated gradingcase study

告诉我们你想交付什么。

预约 30 分钟通话