Modelle vergleichen Bildmodelle vergleichen KI-Tools Modelle KI-Bildmodelle KI-News Suchen Kostenlos testen
Erklärt 8 Min. Lesezeit

Warum KI-Bilder immer noch fake aussehen

Von Chatday Editorial Team ·

kierklärtbildgenerierungwie-es-funktioniertki-bilder
Warum KI-Bilder immer noch fake aussehen

Du schaust seit drei Sekunden auf das Foto von einem Koch, der das Abendessen anrichtet, als dir die Hand auffällt. Der Daumen knickt in die falsche Richtung, und da ist ein fünfter Finger, wo ein vierter sein sollte. Alles andere ist wunderschön. Der Dampf, das Licht, die kleinen Röstspuren auf dem Teller. Aber diese Hand verrät alles, und jetzt kannst du es nicht mehr übersehen.

KI-Bildtools sind weit gekommen. Vor einer Generation verschmierten sie Gesichter und machten aus Zähnen Klaviertasten. Heute erzeugen sie ein Porträt, das fast jeden täuscht. Fast. Es bleibt eine kleine Gruppe von Stellen, an denen die Illusion bricht, und sobald du weißt, wo du hinschauen musst, siehst du sie überall.

Also, das passiert wirklich: warum ein Tool, das Haut und Haare wunderbar malt, immer noch an einer Hand oder einem Straßenschild scheitert, und was das darüber verrät, wie diese Tools ‘sehen’.

Die Merkmale, die noch funktionieren

Manche alten Hinweise sind tot. Plastikhaut, wie retuschiert, und diese identischen Glanzpunkte in beiden Augen schrien früher ‘Fake’. Die neuen Modelle beherrschen Hauttextur und Augenreflexe inzwischen gut, also reichen sie allein nicht mehr.

Was rutscht noch durch? Eine Handvoll Stellen, an denen das Modell viele kleine Dinge gleichzeitig stimmig halten muss.

Wo du hinschaustWas es verrätWarum es passiert
Hände in AktionZu viele oder verschmolzene Finger beim Greifen, Überlappen oder HaltenDie Pose ist komplex und die Details winzig, also werden sie zuletzt und am schlechtesten ausgearbeitet
Text im HintergrundVerlaufene Buchstaben auf einem fernen Schild, einem Buchrücken oder einem EtikettDas Modell steckt die Mühe ins Motiv, nicht ins Kleingedruckte
Reflexe und SchattenEin Spiegel, der etwas anderes zeigt, Schatten, die nirgendwohin zeigenEs malt eine plausibel wirkende Spiegelung, keine physikalisch korrekte
Wiederkehrende MusterZiegelreihen, die sich krümmen, Fliesen, die im Bild ihre Größe ändernEin mathematisch gleichmäßiges Raster über das ganze Bild zu halten, ist schwer
Schmuck und KantenEine Uhr, die halb mit dem Handgelenk verschmilzt, ein Ring, der in die Haut übergehtZwei Flächen, die sauber aneinanderstoßen, sind genau die Grenze, mit der es sich schwertut

Keines davon ist ein sicherer Test. Die besten Modelle von 2026 treffen jedes einzelne davon. Der Trick ist, dass sie fast nie alle auf einmal treffen. Ein Bild kann makellose Hände und lesbaren Text haben, und dann kommt das Licht aus zwei Richtungen, die nicht beide existieren können.

Warum Hände und Text die KI stolpern lassen

Jetzt kommt der Teil, der überrascht. Das Modell zeichnet keine Hand. Es hat keine Ahnung, dass eine Hand existiert.

Peter Bentley, Informatiker am University College London, sagte es in einem Interview mit BBC Science Focus ganz klar: Das seien ‘2D-Bildgeneratoren, die keinerlei Vorstellung von der dreidimensionalen Geometrie von etwas wie einer Hand haben’. Sie lernen, indem sie Millionen Bilder aufsaugen und Muster aufschnappen. Eine Hand hat meist eine Handfläche, ein paar Finger und ein paar Nägel. Aber, wie Bentley sagt, ‘keines dieser Modelle versteht wirklich, was das Ganze ist’.

Denk weniger an einen Maler und mehr an eine Autovervollständigung für Pixel. Das Modell sagt voraus, was als Nächstes kommen sollte, basierend auf dem, was es gesehen hat, ohne je bis fünf zu zählen oder zu überlegen, welcher Finger wohin gehört. Bitte es um zwei Hände mit ineinander verschränkten Fingern, und du bekommst, in Bentleys Worten, ‘zwei Handgelenke und einen Ball aus Fingern’. Es rät eine Form, die es sehr oft gesehen, aber nie wirklich verstanden hat.

Das erklärt auch das Problem mit den Trainingsdaten. Auf den meisten Fotos sind Hände ein Durcheinander. Sie sind halb verdeckt, zur Faust geballt, winkend, eine Kaffeetasse haltend oder so gedreht, dass nur zwei Finger zu sehen sind. Gesichter blicken auf Millionen sauberer Aufnahmen direkt in die Kamera, also sehen Modelle Gesichter aus jedem Winkel und in jedem Licht. Hände sehen sie meist mitten in der Bewegung und halb verdeckt, sodass eine entspannte, gespreizte, nach vorn gerichtete Hand in den Daten seltsam selten ist. Das Modell wird großartig bei dem, was es klar gesehen hat, und wackelig bei dem, was es in Bruchstücken gesehen hat.

Beim Text ist es dieselbe Geschichte in anderem Gewand. Für das Modell sind Buchstaben Formen, keine Sprache. Es weiß, dass ein Schild buchstabenähnliche Zeichen tragen sollte, also malt es buchstabenähnliche Zeichen. Aus der Nähe, auf einer Überschrift, können die neuen Modelle schreiben. Schick es zu einem fernen Schaufenster oder einer Wand voll Kleingedrucktem, und es fällt zurück auf Gekritzel, das nur aus der Ferne nach Wörtern aussieht.

Was die neuen Modelle behoben haben, und was nicht

Es wäre unfair zu tun, als hätte sich nichts geändert. Es hat sich viel geändert.

Haut sieht jetzt echt aus, mit Poren und Korn statt diesem wächsernen Schimmer. Die Augen passen zusammen. Gesichter haben Mikroausdrücke, die der alten Steifheit des Uncanny Valley entgehen. Kurzer, gut sichtbarer Text kommt oft sauber heraus. Einfache, ruhende Hände, die nur im Schoß liegen, gelingen meist. Würdest du heute ein Spitzenbild ohne einen einzigen Hinweis sehen, würdest du nicht mit der Wimper zucken.

Was sich hält, ist alles, was vom Modell verlangt, Regeln zu verstehen, statt Erscheinungen zu kopieren. Physik ist der große Brocken. Eine Spiegelung muss der Geometrie gehorchen. Ein Schatten muss zum Licht passen. Eine Hand um eine Tasse muss wissen, dass die Tasse vor einigen Fingern und hinter anderen liegt. Das sind keine Texturprobleme, das sind Logikprobleme, und ein Mustersucher macht keine Logik. Bentley merkt an, dass die Lösung wohl über das Training mit echten 3D-Formen läuft, damit die Modelle ‘die Form hinter den Bildern verstehen’, und es gibt bereits erste Arbeiten in diese Richtung, aber die Alltags-Tools, die du benutzt, malen weiterhin flache Vermutungen.

Wenn dich neugierig macht, wie weit das Feld gerade beim Text-Problem gekommen ist, sind wir dem in die KI hat endlich gelernt, in Bildern zu schreiben nachgegangen. Und wenn du nur wissen willst, welches Tool heute die saubersten Ergebnisse liefert, haben wir sie in den besten KI-Bildgeneratoren nebeneinandergestellt.

So bekommst du KI-Bilder, die nicht fake aussehen

Zu wissen, warum Bilder brechen, sagt dir genau, wie du es vermeidest. Du lenkst das Modell weg von dem, was es vermasselt.

Halte Hände ruhig oder aus dem Bild. Wenn eine Hand nichts Kniffliges tun muss, lass sie es nicht tun. Bitte um ruhende Hände, in den Taschen, oder schneide einfach enger zu. Ein Porträt ab der Brust umgeht das ganze Problem.

Verlang vom Bild nicht, deine Worte zu tragen. Wenn du eine Überschrift, ein Logo oder eine Bildunterschrift brauchst, füge sie danach in einem beliebigen Design-Tool hinzu. Lass das Modell das Bild machen und setze den echten Text selbst darüber. Er wird scharf, korrekt und deiner.

Beschreib das Licht. Sag, woher es kommt. ‘Weiches Fensterlicht von links’ gibt dem Modell eine Regel zum Befolgen, und Schatten und Reflexe fallen eher an ihren Platz, statt in zufällige Richtungen zu zeigen.

Generieren, korrigieren, neu generieren. Das erste Ergebnis ist ein Entwurf. Finde den Hinweis, feile am Prompt oder ändere ein Detail, und starte erneut. Wer saubere Bilder bekommt, hat kein Glück, sondern macht einfach zwei, drei Durchläufe. Hier hilft es, an einem Ort zu arbeiten, weil du generieren, das verlaufene Schild sehen und erneut starten kannst, ohne zwischen Apps zu springen. Derselbe Trick treibt viele der mit KI gemachten Produktfotos an: ein paar schnelle Durchläufe, kein einziger perfekter Prompt.

Nutze das ‘Unperfekte’ bewusst. Eine leicht körnige, außermittige, echt wirkende Aufnahme liest sich authentischer als eine makellose. Das ist längst eine eigene Ästhetik, und wir haben darüber geschrieben, warum KI-Fotos absichtlich unperfekt aussehen.

Nein. Die besten Modelle von 2026 bestehen jede einzelne Prüfung. Verlässlich ist das Kombinieren: schau dir Hände, Hintergrundtext, Reflexe und wiederkehrende Muster zusammen an, denn ein Fake trifft selten alles auf einmal.
Weil sie eine Hand nicht als 3D-Objekt versteht. Sie sagt Pixel aus gesehenen Mustern voraus, und auf den Trainingsfotos tauchen Hände selten und halb verdeckt auf, also kommen komplexe Posen mit zu vielen oder verschmolzenen Fingern heraus.
Eigentlich nicht. Glatte Haut und identische Augenreflexe werden inzwischen gut gemeistert. Achte lieber auf die Physik: Schatten, Reflexe und wie sich Objekte überlappen.
Halte Hände einfach oder aus dem Bild, füge den Text selbst später hinzu, beschreib, woher das Licht kommt, und mach zwei, drei Durchläufe, statt zu erwarten, dass der erste Versuch perfekt ist.

Ehrlich ist nicht, dass KI-Bilder schlecht sind. Sie sind selbstsicher, und Selbstsicherheit ist nicht dasselbe wie richtig. Verbring dreißig Sekunden mit den Ecken des Bildes, dann weißt du es. Und wenn du dann deine eigenen machst, kannst du das Tool auf das richten, was es gut kann, und den Rest still umgehen.