← JournalMaximilian Friedrich
4 Min. Lesezeit

KI-Spots wirken schwächer, auch wenn niemand sie als KI erkennt — damit ist ein Argument hinfällig, das ich hier selbst gemacht habe

Eine Studie mit 3.000 Befragten hat menschliche und KI-erzeugte Werbespots gegeneinander getestet. Kaum jemand konnte sie unterscheiden, gewirkt haben sie trotzdem unterschiedlich. Warum mich das mehr beschäftigt als jede Umfrage zur Ablehnung.

Vor gut drei Wochen habe ich hier geschrieben: Was Menschen als KI-Werbung erkennen und ablehnen, ist die schlecht gemachte KI. Die gute laufe unter „normale Werbung“ und tauche in keiner Ablehnungsquote auf. Abgelehnt werde also nicht das Verfahren, sondern ein Qualitätsniveau.

Am 3. September hat die Harvard Business Review eine Studie aufgegriffen, die genau diesen Gedanken prüft. Das Ergebnis spricht gegen mich.

Was getestet wurde

Das Marktforschungsinstitut Ipsos hat gemeinsam mit der Newhouse School der Syracuse University 20 Spots von 10 Marken getestet, darunter Cheerios, H&M, Visa und TurboTax. 3.000 Befragte in den USA. Die eine Hälfte waren echte Spots, produziert vor 2021, damit keine KI im Spiel war. Für jeden davon entstand ein Gegenstück: Aus dem Original wurde das Briefing zurückgerechnet, daraus ließ ein Sprachmodell ein Konzept samt Shotlist entwickeln, ein Videomodell setzte es um. Dieselbe Aufgabe, nur ein anderer Urheber.

Die Befragten konnten die beiden kaum auseinanderhalten. Rund 40 Prozent waren unsicher, ob ein Spot von Menschen oder von einer KI stammt.

Gewirkt haben sie trotzdem unterschiedlich. Laut Ipsos waren die menschlichen Spots im Schnitt 14 Prozent stärker in der kurzfristigen Wirkung und 17 Prozent stärker beim Beitrag zur Marke auf lange Sicht. Die Universität formuliert es gegen einen Vergleichswert: Menschliche Spots lagen im Schnitt 11 Punkte darüber, KI-Spots 5 Punkte darunter.

Wo die Quellen sich widersprechen

Bei einer Zahl passen die beiden Veröffentlichungen nicht zusammen. Die Meldung der Syracuse University schreibt, nur 13 Prozent derjenigen, die einen KI-Spot sahen, seien sich zumindest einigermaßen sicher gewesen, dass er von einer KI stammt. Im Bericht von Ipsos stehen an derselben Stelle 25 Prozent. Welche Zahl stimmt, kann ich von außen nicht klären. An der Aussage ändert es wenig: In beiden Fällen hat die große Mehrheit den KI-Spot nicht als solchen erkannt.

Dazu passt eine zweite Erhebung, die am 16. September erschienen ist. Die US-Agentur Net Conversion hat 1.500 Erwachsene befragt; 54 Prozent sagen, sie vertrauen einer Marke weniger, wenn deren Werbung nach KI aussieht. Ein Werbedienstleister, der Verbraucher befragt, ist keine neutrale Instanz, und es ist eine Selbstauskunft. Zusammen mit der Studie ergibt sich trotzdem ein unbequemes Bild: Die Leute sagen, sie strafen erkennbare KI ab. Gemessen wird aber ein Nachteil auch dort, wo sie nichts erkennen.

Woran es liegt

Der aufschlussreichste Befund steht nicht in den Prozentwerten, sondern in einer Nebenbemerkung. Ipsos zählt, wie oft ein Spot eine Geschichte erzählt. In einem anderen Ipsos-Bericht taten das 49 Prozent der untersuchten Werbung, bei den KI-Spots dieser Studie nur 30 Prozent. Laut Universität schnitten die KI-Spots bei einfachen, produktgetriebenen Briefings am besten ab und hatten Mühe mit Erzählung und Gefühl.

Das Problem war also nicht das Bild. Es war die Entscheidung, was gezeigt wird und warum. Das ist keine Frage der Bildqualität, und bessere Modelle lösen sie nicht von selbst.

Das Gegenargument

Es liegt nahe, und ich will es nicht kleiner machen, als es ist: Getestet wurde eine Kette ohne menschliche Kreativarbeit. Briefing, Idee und Umsetzung kamen aus der Maschine. So arbeitet niemand, der damit ernsthaft Geld verdient, ich auch nicht. Bei mir kommen Idee, Auswahl und Schnitt von mir; das Modell liefert das Material. Die Studie misst also etwas anderes als das, was ich verkaufe.

Dazu kommen die Grenzen, die Ipsos selbst nennt: 20 Spots sind eine kleine Stichprobe, und die Technik entwickelt sich schnell. Naiv wäre es, so der Bericht, anzunehmen, dass sich die Lücke nicht weiter schließt.

Das stimmt alles. Es beweist aber nur, dass die Studie meinen Ablauf nicht getestet hat. Dass mein Ablauf die Lücke schließt, beweist es nicht. Diesen Beleg habe ich bisher nicht, und ich sollte nicht so tun, als hätte ich ihn.

Was ich daraus mache

  • —Die These vom Qualitätsniveau ziehe ich in dieser Form zurück. „Man sieht es nicht“ ist kein Wirkungsnachweis. Ich werde es Kunden gegenüber nicht mehr so verwenden.
  • —Die Idee kommt vor dem Material. Wenn der Nachteil bei Erzählung und Gefühl liegt, dann gehört meine Zeit in den Teil, den die Studie automatisiert hat: das Briefing, den Einfall, die Frage, was der Spot eigentlich erzählen soll.
  • —Wo es passt, KI ohne Umweg. Für klare Produktbotschaften und Varianten, also dort, wo die KI-Spots am besten abschnitten, ist der Einsatz vertretbar. Für den Markenfilm, der Gefühl tragen soll, empfehle ich eher, zu testen, bevor Geld in die Ausspielung geht.

Zum Stand: Die Zahlen geben den Stand vom 18. September 2026 wieder. Beide Erhebungen bilden den US-Markt ab, nicht den deutschsprachigen. Die Studie stammt vom Mai 2026 und wurde im September durch die Harvard Business Review breiter bekannt.

Du willst so etwas für deine Marke — Bilder, Bewegtbild oder eine Seite, ohne Shooting?

Was das kostet →