← Zurück zum Blog

Kann KI deinen Job übernehmen?

Ein viel geteiltes Video trägt den Titel “Princeton Just Proved AI Can’t Take Your Job”. Es stützt sich auf eine aktuelle Studie von Forschenden der Princeton University, bekannt für ihre hochrangigen Studiengänge in Mathematik und Public Policy. Sie haben getestet, ob KI-Agenten (KI-Systeme, die eine Aufgabe selbstständig und mit Werkzeugen bearbeiten) eigenständig forschen können. Das Video ist gut gemacht, und ein Teil davon stimmt. Doch das Wort „bewiesen“ geht deutlich zu weit. Wir haben die Primärquellen gelesen, und das Bild ist differenzierter und unbequemer als das Video und der KI-Hype.

Was das für dich bedeutet

Die nützlichste Idee des Videos hält stand: Ein Job ist mehr als ein Bündel von Aufgaben. In der Studie ließen die Forschenden KI-Agenten selbstständig ein Forschungsprojekt bearbeiten. Die Routinearbeit erledigten die Agenten, beim Urteilen taten sie sich schwer: zu entscheiden, was gut genug für eine Veröffentlichung ist, wann ein Ansatz nicht mehr trägt und warum ein Schritt überhaupt relevant ist. In diesen Bereichen schaffen Menschen den größten Mehrwert.

Als Garantie taugt das allerdings nicht. Die nüchterne Lesart der Belege: Heutige KI ist stark bei Aufgaben und schwach bei offenem Urteilen. Diese Lücke ist real, und sie kann kleiner werden. Für Berufseinsteiger ist der Druck schon spürbar.

Damit wird die praktische Frage persönlich: Welche Teile deiner Arbeit sind Aufgaben, welche sind Urteilsvermögen? Wo kannst du dich stärker in Richtung Urteilsvermögen entwickeln?

Was die Princeton-Studie wirklich getestet hat

Das Paper heißt Can AI agents conduct open-ended AI research? und stammt von einem Team unter Princeton-Leitung, mit Koautorinnen und Koautoren aus vielen Institutionen. Die Forschenden gaben KI-Agenten der Spitzenklasse sechs Tage und Rechenleistung im Wert von mehreren tausend Dollar, um die zentrale Forschungsfrage zweier unveröffentlichter Konferenzeinreichungen zu bearbeiten. Anschließend bewerteten die ursprünglichen Autoren das Ergebnis.

Beide Arbeiten wurden abgelehnt. Die Agenten erledigten die Ingenieursarbeit, kamen bei den Forschungsfragen aber nicht substanziell voran. Das Team nennt fünf typische Schwächen, darunter ein unsicheres Urteil darüber, was publikationsreif ist, mangelnde Bereitschaft, falsche Gedankengänge aufzugeben, und das Abdriften von den Vorgaben.

Das ist ein echter und nützlicher Befund, aber ein kleiner: zwei Arbeiten, insgesamt fünf Durchläufe, Gutachter, die wussten, dass eine KI die Arbeit verfasst hatte. Die Autoren sprechen selbst von „frühen Belegen“ und halten es für möglich, dass sich die Ergebnisse nicht auf andere Forschung übertragen lassen. Über Beschäftigung sagt das Paper nichts. Es ist eine Studie über KI-Forschung, nicht über deinen Job.

Der „mathematische Beweis“, der keiner ist

Das gewichtigste Argument des Videos ist Judea Pearls Leiter der Kausalität: Beobachten, Eingreifen, Vorstellen. Weil Sprachmodelle aus Daten lernen, seien sie laut Video „mathematisch bewiesen“ auf der untersten Sprosse gefangen.

Die zugrunde liegende Mathematik ist real. Sie besagt, dass rein beobachtende Daten allein keine Antworten über Eingriffe oder Gegenfaktisches festlegen. Das ist aber eine Aussage über eine bestimmte Art von Daten, nicht über jedes System, das mit Text trainiert und anschließend durch Handeln in der Welt verfeinert wird.

Pearl selbst hat ähnlich argumentiert. In einem Interview von 2023 sagte er, die Beschränkungen der Leiter „gelten nicht mehr, weil die Daten Text sind und Text Informationen über Ebene zwei und drei enthalten kann“ (sinngemäß übersetzt). Er sieht weiterhin echte Grenzen: Reinforcement Learning liege auf „Ebene eins und drei Viertel“, weil Maschinen über nicht ausprobierte Züge wenig ableiten können. Das ist eine differenzierte Position, kein Beweis dafür, dass Sprachmodelle nicht kausal denken können.

Empirisch ist das Bild gemischt, was etwas anderes ist als „unmöglich“. In einer Benchmark-Studie erreichten GPT-3.5 und GPT-4 97 % bei der kausalen Entdeckung und 92 % beim kontrafaktischen Schließen, bei unvorhersehbaren Aussetzern. In einem strengeren formalen Test (CLadder) erzielte das beste Modell rund 83 % auf der untersten Sprosse und 62 % bei kontrafaktischen Fragen. Die Leistung sinkt also mit jeder Sprosse, und insofern hat das Video recht, dass höhere Ebenen schwerer sind. Eine unüberwindbare Grenze ist das nicht.

„Das ist nur Rechenleistung“ ist keine Widerlegung

Das Video argumentiert, KI-„Denken“ sei bloß zusätzliche Berechnung, und verweist auf ein Paper, in dem sinnlose Füllpunkte ebenso gut funktionierten wie ausgeschriebene Schritte. Das Paper ist real, aber die Autoren halten fest, dass der Trick dichtes, gezieltes Training brauchte und als natürliches Verhalten nicht belegt ist.

Wichtiger noch: „zusätzliche Rechenleistung“ und „Denken“ sind keine Gegensätze. Ein theoretisches Ergebnis zeigt, dass ausgeschriebene Zwischenschritte Transformern serielle Berechnung ermöglichen, die ihnen sonst fehlt. Interpretierbarkeitsforschung an Claude fand, dass das Modell mehrstufige Schlüsse intern durchführt, bevor es antwortet. Und ein Meta-Paper zeigte, dass Denken in einem kontinuierlichen inneren Raum bei zwei Logik-Benchmarks besser abschnitt als ausgeschriebene Schritte (97 % gegenüber 77,5 % bei einem davon), bei einfachen Textaufgaben in Mathematik aber schlechter. Auch für Maschinen ist Denken ohne Worte möglich. Die Neurowissenschaft der Aphasie sagt nichts anderes.

Jobs: im Schnitt beruhigend, für Berufseinsteiger nicht

Zur Jobfrage sagt das Video, KI automatisiere Aufgaben, nicht Berufe. Heute stimmen die Daten im Durchschnitt zu. Die Analyse des Yale Budget Lab vom Mai 2026 fand noch keine klaren Hinweise auf KI-Effekte am Arbeitsmarkt.

Durchschnitte verdecken jedoch, was an den Rändern geschieht. Eine Stanford-Analyse von Gehaltsdaten zeigt, dass die Beschäftigung der 22- bis 25-Jährigen in KI-exponierten Berufen im Juni 2026 rund 19 % niedriger liegt, als wenn sie mit jungen Beschäftigten in weniger exponierten Berufen Schritt gehalten hätte. Bei erfahrenen Beschäftigten zeigt sich keine vergleichbare Lücke. Die Autoren sind vorsichtig: Das Muster ist beschreibend und kein Beleg für eine Ursache. Zinsen und Homeoffice erklären es demnach nicht, doch die Lücke schrumpft, sobald man den Bildungsstand berücksichtigt.

Und „Aufgaben, nicht Berufe“ beschreibt den heutigen Stand, nicht die Richtung des Trends. Beim Remote Labor Index, der Agenten an echten Freelance-Projekten testet, stieg das beste Ergebnis von 2,5 % Ende 2025 auf 15,8 % Mitte 2026. Der Großteil der Arbeit ist weiterhin nicht automatisiert, und die Autoren des Benchmarks weisen darauf hin, dass automatische Bewertung neuere Modelle begünstigt. Beides stimmt gleichzeitig.

Das Waschmaschinen-Argument schneidet in beide Richtungen

Der optimistische Fall des Videos: Die Nachfrage wächst immer, neue Technik schafft mehr Arbeit, als sie beseitigt. Der Ökonom James Bessen hat genau das in Textil, Stahl und Autoindustrie belegt. Dasselbe Paper zeigt auch die zweite Hälfte der Geschichte: Nach einer Wachstumsphase war die Nachfrage gesättigt, und die Beschäftigung sank. Elastische Nachfrage ist eine Phase, kein Gesetz. Ob Schreiben, Analyse und Code eher dem Textilsektor von 1850 oder der Stahlindustrie von 1990 gleichen, ist offen. Gemessen hat das bisher niemand.

Für die verbreitete Behauptung, Compiler hätten Millionen Programmierer geschaffen, fanden wir keine belastbare Quelle. Und die Haushaltsgeräte-Geschichte ist real, aber sie handelt von gewonnener Zeit zu Hause, nicht davon, dass Verdrängte neue Jobs fanden.

Herauszuarbeiten, welche Teile deiner Arbeit Aufgaben und welche Urteilsvermögen sind, ist der Kern unseres Coachings, mit KI als Werkzeug, das dir die Aufgaben abnimmt, damit Raum für das Urteil bleibt. Wenn du das für deine Rolle erkunden möchtest, sprechen wir darüber.

Die Quellen sind direkt verlinkt. Einige sind Preprints oder Studien von KI-Labs und nicht peer-reviewed, und die Arbeitsmarktbefunde sind noch früh.