dieser beitrag. ein anonymisiertes ergebnis. ein online-bildungsunternehmen mit 4-monatigen live-kohorten hat die bewertungszeit pro kohorte um 70 % gesenkt. die ai bewertet jede aufgabe nach der eigenen rubrik des kunden. eine person übernimmt weiterhin die fälle, die urteilsvermögen brauchen.
die käuferin hier ist eine head of learning bei einem online-kursanbieter. die kohorten sind live und dauern 4 monate. jede aufgabe wird von hand bewertet. diese arbeit frisst dozentenstunden, und dozentenstunden sind der größte posten in den kosten der kohorte. die marge sickert eine einreichung nach der anderen weg.
die angst galt der qualität. wirf ein tool auf den stapel, und die bewertung wird schneller und schlechter. das sagten die dozierenden offen. also haben wir sie nicht ersetzt. wir haben eine lms-erweiterung ausgeliefert, die aufgaben nach ihrer rubrik bewertet und jede bewertung in einem stichproben-audit-dashboard zeigt.
#macht ai-bewertung online-kurse günstiger, ohne sie schlechter zu machen?
senkt ai-bewertung für online-kurse die kosten, ohne die qualität zu beeinträchtigen?
in diesem projekt: ja. ein online-kursanbieter hat die bewertungszeit pro kohorte um 70 % gesenkt, indem er aufgaben mit ai nach der eigenen rubrik bewertet und die grenzwertigen 15 % an dozierende eskaliert hat. der nps für die dozentenqualität blieb stabil. die rubrik blieb die des kunden. jeder grenzfall lag weiterhin in der verantwortung eines menschen.
das hat die qualität konstant gehalten. die rubrik blieb die des kunden. die ai wandte sie konsistent auf die eindeutigen 85 % der einreichungen an. die grenzfälle eskalierte sie an einen menschen. so verbrachten die dozierenden ihre stunden auf den 15 %, die tatsächlich urteilsvermögen brauchten, nicht auf dem ganzen stapel.
#woher kommen die 70 % tatsächlich?
nicht davon, jede arbeit schneller zu bewerten. davon, weniger davon von hand zu bewerten. etwa 85 % der einreichungen in diesen kohorten waren gegenüber der rubrik eindeutig bestanden oder eindeutig durchgefallen. das sind die, die die ai bewertet hat. die 15 %, die nahe an einer rubrik-grenze lagen, gingen an eine dozentin oder einen dozenten, mit der rubrikzeile und der arbeit der studierenden nebeneinander.
- die lms-erweiterung liest jede einreichung und bewertet sie gegen die bestehende rubrik des kunden
- ein konfidenz-schwellenwert teilt den stapel: eindeutige fälle werden bewertet, grenzfälle werden eskaliert
- ein stichproben-audit-dashboard lässt dozierende jeden batch ziehen und jede bewertung überschreiben
- jede bewertung lässt sich auf die rubrikzeile zurückführen, aus der sie stammt
#woher wissen dozierende, dass die bewertungen stimmen?
sie prüfen. jeder batch erscheint in einem dashboard, in dem eine dozentin eine stichprobe ziehen, die bewertung der ai neben der rubrik lesen und sie überschreiben kann. deshalb blieb der nps für die dozentenqualität stabil. die leute, die den qualitätsverlust fürchteten, sind dieselben, die die arbeit prüfen.
we are
wir liefern eine lms-erweiterung, die nach eurer rubrik bewertet und dozierenden ein dashboard zum prüfen und überschreiben gibt, und wir nennen die zahl: 70 % weniger bewertungszeit pro kohorte.
we aren't
wir sind kein allgemeiner bewertungs-bot, der eure standards gegen seine eigenen tauscht und den ganzen stapel ungelesen bewertet.
dieser build gehört zu unserer platforms-arbeit: software, die in eurem produkt läuft. das rubrik-design und die human-in-the-loop-regel kamen von der consultancy-seite. wir liefern nicht ein modell und verschwinden dann. wir liefern die erweiterung, das dashboard und die eskalationsregel zusammen.
der kunde wollte noch nicht genannt werden. die zahl ist echt, und der build ist echt. wir veröffentlichen das ergebnis und einen beleg, denn eine fallstudie ohne beleg ist nur eine behauptung. mehr davon findest du im journal.
die ai bewertet die offensichtlichen fälle. die lehrkraft übernimmt die schwierigen.
wenn du kohorten leitest und die bewertung deine marge auffrisst, wiederholt sich das muster von oben. gleiche rubrik, gleiche dozierende, weniger stunden auf dem offensichtlichen stapel. erzähl uns, was du baust, und wir zeigen dir, woher die 70 % in deinen kursen kommen würden.