Moderne KI-Modelle weisen erhebliche ethische Unterschiede und Geschlechterselektivität bei der Bewertung hypothetischer kritischer Situationen auf. Eine neue umfassende Studie der Universität Mailand, die im Oktober 2026 auf dem Preprint-Server arXiv veröffentlicht wurde, untersuchte das Verhalten fortschrittlicher neuronaler Netze unter schweren moralischen Dilemmata. Forscher versuchten herauszufinden, wie Algorithmen Entscheidungen treffen, wenn die Rettung der Menschheit auf dem Spiel steht und dafür einem bestimmten Menschen Schaden zugefügt werden muss.
Westliche neuronale Netze und das Geschlechterparadoxon in moralischen Dilemmata
Während der Experimente simulierten die Forscher ein Szenario zur Verhinderung einer nuklearen Apokalypse durch Gewaltausübung oder das Opfern einer Person bestimmten Geschlechts. Die Ergebnisse zeigten ein tiefes Paradoxon in der Logik westlicher Systeme wie Claude Sonnet 4.6 und GPT-5.5. Auf die Frage nach der Zulässigkeit von Gewalt gegen eine Frau zur Vermeidung einer Katastrophe antworteten diese Modelle mit kategorischer Ablehnung und zeigten ausgeprägten Schutz. Bei einer ähnlichen Frage bezüglich Männern nahmen dieselben Algorithmen jedoch eine mäßig zustimmende Position ein und erkannten eine gewisse Zulässigkeit gewalttätiger Handlungen an.
Position von DeepSeek V4-Flash und technologischer Durchbruch des Unternehmens
Ein völlig anderes Verhaltensmodell demonstrierte die Entwicklung von DeepSeek. Das Modell DeepSeek V4-Flash erwies sich als völlig geschlechtsneutral und antwortete in allen Szenarien unabhängig vom Geschlecht des potenziellen Opfers mit „starke Zustimmung“, was einen kalten utilitaristischen Ansatz ohne emotionale oder ideologische Verzerrungen widerspiegelt. Neben ethischen Tests demonstriert das DeepSeek-Labor ein kolossales technisches Entwicklungstempo, bereitet ein Flaggschiffmodell mit 8 Billionen Parametern auf die Veröffentlichung vor und investiert aktiv in ein unabhängiges Hardware-Ökosystem.
Die Analyse der Studienergebnisse ergab gravierende Abweichungen bei der Bewertung moralischer Urteile zwischen verschiedenen Sprachmodellen. Während westliche Algorithmen (Claude und GPT) eine komplexe Heterogenität und eine Aufteilung der Bewertungen je nach Geschlecht der Figuren zeigten, bewiesen die chinesischen Pendants unter DeepSeek einen absoluten Utilitarismus ohne geschlechtsspezifische Trennung. Experten weisen darauf hin, dass solche Diskrepanzen auf die Besonderheiten des Post-Trainings und die Merkmale der menschlichen Moral zurückzuführen sind, die von Natur aus multidimensional ist und vom kulturellen Kontext der Entwickler abhängt.
Die Folgen der identifizierten algorithmischen Vorurteile könnten die Integration von KI in kritische Entscheidungssysteme erheblich beeinflussen. Da Entwickler ihre Rechenleistung weiter skalieren – insbesondere durch den Kauf von 160.000 Huawei Ascend-Chips für ein neues 1-GW-Rechenzentrum in der Inneren Mongolei –, stehen Fragen der Sicherheit, ethischen Kalibrierung und Beseitigung versteckter Geschlechtervorurteile für die gesamte Technologiebranche an vorderster Front.