Scovai Scovai
AI & Operations 2026-09-16 1 min read

Ihre Extravertierten passen am schlechtesten zu einer gewissenhaften KI: Das neue PNAS-Experiment des MIT zeigt, dass die für alle ausgerollte Assistenten-Persona eine Leistungsvariable ist

DSL

Dr. Sarah Liu

Ihre Extravertierten passen am schlechtesten zu einer gewissenhaften KI: Das neue PNAS-Experiment des MIT zeigt, dass die für alle ausgerollte Assistenten-Persona eine Leistungsvariable ist

Koppeln Sie 1.258 Menschen mit KI-Agenten, lassen Sie sie 7.266 Display-Anzeigen produzieren und anschließend von 1.168 unabhängigen Bewertern beurteilen. Die schlechteste Kombination im gesamten Versuchsaufbau war weder ein schwaches Modell noch ein ungeschulter Nutzer. Es waren extravertierte Menschen, die mit einer gewissenhaften KI arbeiteten (Ju & Aral, PNAS, 2026).

Gewissenhaft. Genau die Eigenschaft, auf die jeder Anbieter seine Modelle standardmäßig trimmt — sorgfältig, gründlich, bei der Sache. Der falschen Person zugewiesen, erzeugte sie die schlechteste Arbeit des Experiments.

Das ist der Befund, bei dem Operations-Teams im Mittelstand innehalten sollten, denn nahezu alle haben die gegenteilige Wette abgeschlossen: eine einzige Assistenten-Persona, einmal konfiguriert, an alle ausgerollt. Diese Studie ist der erste groß angelegte kausale Beleg dafür, dass die Persona selbst eine Leistungsvariable ist — und dass es eine Entscheidung und kein neutraler Zustand ist, sie auf der Voreinstellung des Anbieters zu belassen.

Was das Experiment tatsächlich gemessen hat

Harang Ju (Johns Hopkins Carey Business School) und Sinan Aral (MIT Sloan, Direktor der MIT Initiative on the Digital Economy) führten ein präregistriertes randomisiertes Experiment durch: 1.258 Teilnehmende wurden auf den Big-Five-Merkmalen gemessen und anschließend zufällig KI-Agenten zugeordnet, die angewiesen waren, unabhängig voneinander hohe oder niedrige Ausprägungen eben dieser fünf Merkmale zu zeigen (Ju & Aral, PNAS, 2026).

Die Teams hatten 40 Minuten, Echtzeit-Chat sowie synchronisierte Text- und Bildbearbeitungswerkzeuge, um Display-Anzeigen für den Jahresbericht eines realen Thinktanks zu erstellen. Ergebnis: 7.266 Anzeigen. Diese wurden danach von 1.168 unabhängigen Bewertern nach Text- und Bildqualität beurteilt (MIT Sloan / EurekAlert, 2026).

Dann folgt der Teil, der daraus mehr als ein Laborergebnis macht. Die Forscher schalteten die Anzeigen zwei Wochen lang auf X — nahezu fünf Millionen Impressionen — und maßen Klickrate und Kosten pro Klick. Die bewertete Qualität sagte die Marktleistung vorher: höhere Textqualität steigerte die Klickrate um rund 7 Prozent und senkte die Kosten pro Klick um etwa 30 Cent (MIT Sloan / EurekAlert, 2026).

Zwei Designentscheidungen verdienen Betonung, denn sie unterscheiden diese Arbeit von den bereits kursierenden Persona-Kommentaren. Die Merkmalsausprägungen wurden zufällig zugewiesen und unabhängig variiert, der Vergleich läuft also nicht über selbstselektierte Nutzer unterschiedlicher Werkzeuge — er ist kausal. Und die Studie maß die Menschen mit demselben Big-Five-Instrument, mit dem die Agenten instruiert wurden; genau das macht die Interaktion überhaupt schätzbar. Die meisten Anbieterstudien berichten, wie Nutzer eine Persona empfinden. Diese berichtet, was die Kopplung mit der Arbeit gemacht hat.

Die Kausalkette ist damit durchgängig geschlossen. Die Persona-Kopplung bewegte die Qualität. Die Qualität bewegte das Geld.

Die Kopplungstabelle: Welche Kombinationen halfen, welche schadeten

Die Ergebnisse lassen sich nicht auf „Gleiches zu Gleichem" reduzieren — was fast alle vor der Lektüre annehmen.

Die stärksten Kopplungen waren extravertierte Menschen mit extravertierter KI, gewissenhafte Menschen mit gewissenhafter KI und offene Menschen mit gewissenhafter KI — Letzteres eine Ergänzung, kein Spiegel (MIT Sloan / EurekAlert, 2026).

Die Kopplungen, die die Qualität signifikant verschlechterten, in der Reihenfolge der Studie:

  1. Extravertierte Menschen + gewissenhafte KI — die niedrigste Qualität der Studie
  2. Gewissenhafte Menschen + verträgliche (agreeable) KI
  3. Neurotische Menschen + gewissenhafte KI

(Ju & Aral, PNAS, 2026)

Lesen Sie die zweite Zeile zweimal

Gewissenhafte KI taucht in zwei der drei schlechtesten und in zwei der drei besten Kopplungen auf. In diesen Daten gibt es keine global gute Persona. Ein gewissenhafter Agent bei einem gewissenhaften Menschen gehörte zu den besten verfügbaren Kombinationen; derselbe Agent bei einem Extravertierten war die schlechteste. Identische Konfiguration, gegenteiliges Ergebnis, vollständig bestimmt davon, wer sie erhalten hat.

Und beachten Sie, was die zweite Zeile mit der Standardantwort der Anbieter macht. Verträgliche KI — hilfsbereit, entgegenkommend, nie widersprechend — verschlechterte die Leistung gewissenhafter Menschen. Die auf Nutzerzufriedenheit optimierteste Persona war ausgerechnet für jene Gruppe schädlich, die mit höchster Wahrscheinlichkeit Ihre sorgfältige Arbeit erledigt.

Warum eine organisationsweite Einheits-Persona eine stille Leistungssteuer ist

Hier die operative Übersetzung, und sie ist gerade deshalb unangenehm, weil die Korrektur nichts kostet und niemand sie misst.

Wenn Sie eine einzige Assistenten-Konfiguration an 300 Menschen ausrollen, führen Sie keinen neutralen Rollout durch. Sie führen ein nicht randomisiertes Experiment durch, in dem ein Teil Ihrer Belegschaft genau jene Kopplung erhalten hat, die diese Studie als Erzeuger der schlechtesten Ergebnisse identifiziert hat — und weder diese Menschen noch Sie verfügen über ein Instrument, das es erkennen würde. Das Versagen zeigt sich als etwas schwächere Entwürfe, etwas mehr Nacharbeit, ein vages Gefühl in bestimmten Teams, das Werkzeug sei „nicht so nützlich". Als Kostenposition erscheint es nie.

Diese Nacharbeit landet an der teuersten Stelle. McKinsey QuantumBlacks Kostenaufschlüsselung agentischer Banking-Workflows beziffert Token-Ausgaben auf 20 bis 25 Prozent der variablen Laufkosten eines Agenten und die menschliche Aufsicht durch Fach- und Risikoexperten auf 70 bis 75 Prozent (McKinsey QuantumBlack, 2026). In dieser Struktur ist Output-Qualität keine weiche Kennzahl. Jeder Qualitätspunkt, den Sie bei der Erzeugung verlieren, wird zum Prüfsatz zurückgezahlt — von der Senior-Person, die kontrolliert.

Und die Kontrolle verschwindet nicht. In der Studie von MIT Technology Review Insights und Microsoft, in der 300 Technologieführungskräfte 101 agentische Aufgaben einordneten, planen bereits 59 Prozent dauerhafte menschliche Aufsicht, wobei Vertrauen eher der Überprüfbarkeit der Aufgabe folgt als der reinen Modellfähigkeit (MIT Technology Review Insights, 2026).

Eine unpassende Persona ist damit keine Beschwerde über die Nutzererfahrung. Sie ist ein stiller Multiplikator auf die größte einzelne Kostenposition Ihres KI-Stacks.

Die Varianz sitzt bereits innerhalb der Stelle

Wenn Sie Belege wollen, dass sich das im eigenen Unternehmen und nicht nur im Labor messen lässt: Sie liegen bereits in den Nutzungsdaten. Bick, Blandin, Deming und Schumacher verknüpften eine national repräsentative Befragung mit detaillierten O*NET-Aufgaben und fanden, dass Expositionsmaße für generative KI nur etwa die Hälfte der Variation in der Nutzung zwischen Beschäftigten erklären — Menschen mit derselben Tätigkeit und denselben Werkzeugen adoptieren systematisch unterschiedlich (NBER Working Paper 35677, 2026).

Die Hälfte der Varianz sitzt innerhalb der Stelle, nicht zwischen Stellen. Die meisten Ops-Teams verbuchen das unter Motivation oder Schulung. Das PNAS-Ergebnis liefert für einen Teil davon eine weniger schmeichelhafte und handlungsfähigere Erklärung: Das Werkzeug ist für einen Menschen konfiguriert, der nicht derjenige ist, der es benutzt.

Diese Umdeutung ändert, was Sie mit einem Cluster niedriger Nutzung tun. Noch eine Enablement-Session an ein Team zu schicken, das still schlechtere Ergebnisse vom Standard-Agenten erhält, adressiert die Ursache nicht — es fügt Menschen Stunden hinzu, deren Entwürfe weiterhin mehr Nacharbeit brauchen werden als die ihrer Kollegen.

Der ehrliche Einwand

Drei Grenzen, und sie zählen.

Die Aufgabe war Anzeigenerstellung, nicht Operations. Vierzigminütige Kreativsitzungen mit Display-Anzeigen sind nicht Ihr Quartalsabschluss, Ihr Lieferanten-Onboarding oder Ihre Ticket-Triage. Dass Persönlichkeitskopplung die Qualität in einer kreativen Aufgabe bewegte, ist ein Befund; dass sie sie in Ihren Workflows bewegt, ist eine Schlussfolgerung. Behandeln Sie es als starke Hypothese, die es zu prüfen gilt, nicht als gesichertes Ergebnis.

Die Autoren haben eine kommerzielle Position. Ju und Aral haben Pairium mitgegründet, das die in der Studie genutzte Experimentierplattform Pairit baut und vertreibt (Ju & Aral, PNAS, 2026). Die Arbeit ist präregistriert und bei PNAS peer-reviewt, was die offensichtlichen Fehlerquellen begrenzt — aber die Forscher mit dem Befund verkaufen auch das Mittel, und das gehört in Ihre Lesart.

Alle perfekt zu koppeln, hat einen eigenen Preis. Arbeiten derselben Literatur finden, dass vielfältige KI-Personas den Homogenisierungseffekt in der kollaborativen Ideenfindung zwischen Mensch und KI abmildern (Wan & Kalman, 2026). Optimieren Sie jede Kopplung auf individuelle Output-Qualität, komprimieren Sie womöglich die Varianz im Denken Ihrer Teams — bessere Entwürfe, ähnlichere Entwürfe. Wenn Ihre Funktion Bandbreite statt Politur braucht, ist dieser Zielkonflikt real.

Nichts davon rettet den Status quo. Die Standardkonfiguration ist keine Absicherung gegen diese Grenzen; sie ist die einzige Option, die garantiert für einen Teil Ihrer Belegschaft falsch ist — ohne dass irgendein Datenpunkt Ihnen sagt, für welchen.

Was in diesem Quartal zu entscheiden ist

Vier Schritte, keiner erfordert neue Anbieterausgaben.

  1. Behandeln Sie die Persona nicht länger als IT-Konfiguration. Der System-Prompt des Assistenten ist ein Leistungsparameter mit gemessenen Effekten auf die Output-Qualität. Wer KI-Enablement verantwortet, verantwortet ihn — und muss die aktuelle Einstellung begründen.
  2. Führen Sie einen Kopplungstest in einer Funktion durch, die bereits bewertbaren Output erzeugt. Content, Support-Antworten, Erstanalysen. Zwei Personas, zufällig zugewiesen, ein Quartal, verblindete Qualitätsbewertungen. Sie replizieren ein publiziertes Design im Kleinen — die günstigste Forschung, die Sie je beauftragen werden.
  3. Schauen Sie besonders genau auf Ihre Extravertierten und Ihre Beschäftigten mit hohem Neurotizismus in Rollen mit hohem Output. Das sind die beiden Profile, die die Studie gegenüber dem gewissenhaften Standard-Agenten markiert hat. Wenn eine sichtbar fähige Person still wenig aus dem Werkzeug zieht, ist Fehlpassung nun eine ernsthafte Hypothese und kein Schulungsproblem.
  4. Bieten Sie Persona-Auswahl an, bevor Sie Persona-Zuweisung bauen. Vollständige merkmalsbasierte Zuordnung braucht Persönlichkeitsdaten, die die meisten Mittelständler nicht haben und vielleicht nicht haben wollen. Zwei oder drei wählbare Assistenzprofile greifen einen Teil des Effekts ab — ohne jede Governance-Exponierung.

KI-Persönlichkeitskopplung ist jetzt eine gemessene Variable mit Preisschild. Sie stellen sie bereits ein — einmal, global, indem Sie akzeptieren, was der Anbieter ausgeliefert hat.

Die Frage für dieses Quartal lautet nicht, ob die Persona zählt. Das hat PNAS beantwortet. Sie lautet, ob Sie diese Entscheidung weiterhin per Voreinstellung für alle treffen und das Ergebnis anschließend dem Modell anlasten.

Ready to go beyond the CV?

Scovai's AI-powered Talent Passport reveals what resumes can't: personality, potential, and true job fit.