In den letzten Tagen eine merkwürdige Ein Bildungsexperiment in Frankreich hat die tatsächlichen Fähigkeiten künstlicher Intelligenz getestet. Die Philosophieprüfungen für das Gymnasium, das bekannte Abitur, standen an. Auslöser war eine offene Frage: Ist die Wahrheit immer überzeugend? Eine typische Frage bei Hochschulaufnahmeprüfungen, die die argumentative Reife von Schülern am Ende der Sekundarstufe misst.
France 3 Hauts-de-France, ein öffentlich-rechtlicher Sender, beschloss, ChatGPT mit dem Verfassen eines Essays zu beauftragen. Als wäre es ein Schüler, der die beste Note anstrebt. Das Ziel? Zu testen, inwieweit eine KI die Filter- und automatischen Bewertungstools der Lehrer überwinden kann.
Der Vorschlag für ChatGPT und die Lehrkriterien
Um die reale Situation nachzubilden, wurde die KI mit einem Detaillierte Aufforderung: sollte den Stil und die Struktur eines älteren Studenten übernehmen, gliedern Sie den Text in eine Einleitung, eine Durchführung und einen Schluss und gehen Sie auf alle Nuancen des Themas ein.
Als die generierte Antwort präsentiert wurde, der Text schien wissenschaftlich korrekt: flüssige Sätze, keine Rechtschreibfehler und eine klare Struktur. Der erste Eindruck bröckelt jedoch bei näherer Betrachtung.
Der mit der Korrektur des Aufsatzes beauftragte Philosophieprofessor vergab 8 von 20 Punkten.Warum so ein niedriger Wert? Hauptsächlich, weil einen Mangel an Tiefe in den Argumenten festgestellt, fehlende Beispiele und vor allem eine unerwartete Wendung in der Fragestellung: Die KI antwortete nicht mehr mit „Ist die Wahrheit immer überzeugend?“, sondern mit „Ist die Wahrheit ausreichend, um zu überzeugen?“ Für den Lehrer zeigte diese Änderung, dass das System die ursprüngliche Anweisung nicht vollständig verstanden hatte – ein erheblicher Fehler bei dieser Art von Tests.
Ein weiterer negativer Aspekt war die Tendenz von ChatGPT, Wiederholung von Standardformeln und Vermeidung persönlicher Reflexion, wodurch das Ergebnis im Vergleich zu dem, was von einem gut vorbereiteten Studenten erwartet wird, zu oberflächlich war.
Andere KI-Systeme und Unterschiede in den Kriterien
Die Prüfung beschränkte sich nicht nur auf die Meinung des Lehrers. Der von ChatGPT generierte Text wurde auch von verschiedenen KIs ausgewertet., darunter Gemini, Perplexity, DeepSeek und Copilot. Alle waren sich einig über geben viel höhere Punktzahlen: zwischen 15 und 19,5 von 20.
Was erklärt diesen auffälligen Unterschied? Die automatisierten Plattformen betonten die gute formale Struktur und die oberflächliche Kohärenz des Aufsatzes, aber keiner hat den entscheidenden Fehler beim Verständnis des Themas erkannt noch der vom Lehrer festgestellte Mangel an argumentativer Präzision. Darüber hinaus bewertete sich ChatGPT selbst mit 19,5/20 Punkten und zeigte damit wenig Selbstkritik.
Für den Lehrer bestätigt dies alles, dass KIs können mechanische Anforderungen gut erfüllen – geordnetes Schreiben, Konnektoren, einfache Beispiele –, aber sie sind nicht in der Lage, tiefer zu gehen, zu nuancieren oder die konzeptionellen und philosophischen Nuancen zu erfassen, die in diesen Übungen erforderlich sind.
Die aktuellen Grenzen der KI im Bildungswesen
Dieser Fall diente dazu, den Tisch zu legen Die aktuellen Grenzen der künstlichen Intelligenz in Bezug auf philosophische Reflexion und kritische AnalyseObwohl Programme wie ChatGPT formale Aspekte sehr gut handhaben und scheinbar überzeugende Texte produzieren, Die Fähigkeit zu argumentieren, zu hinterfragen oder eigene Standpunkte einzubringen ist immer noch weit geringer als die des echten Studenten.
Der Aufsatz wird geschätzt, über die gut verbundenen Wörter hinaus, keine originelle Argumentation gezeigt oder nicht präzise auf Anfragen reagiertDer Lehrer bemerkte, dass Ein Student hätte über alles nachgedacht, was fehlte, und wäre viel besser gefahren..
Andererseits unterstreicht die Tatsache, dass KI-Tools Texte, die von anderen KI-Tools generiert wurden, so positiv bewerten das Vorhandensein von Verzerrungen in automatischen Bewertungssystemen, bei denen die Form Vorrang vor dem Inhalt hat und die weniger anspruchsvolle konzeptionelle Analysen erfordern.