Сравнить модели Сравнить модели изображений AI-инструменты Модели AI-модели изображений Новости об AI Поиск Попробовать бесплатно
Объяснение 8 мин чтения

Почему ИИ-картинки всё ещё выглядят фальшиво

Автор Chatday Editorial Team ·

aiобъяснениегенерация-изображенийкак-работаетai-изображения
Почему ИИ-картинки всё ещё выглядят фальшиво

Ты уже три секунды смотришь на фото повара, раскладывающего ужин по тарелке, когда замечаешь руку. Большой палец гнётся не в ту сторону, и там пятый палец, где должен быть четвёртый. Всё остальное прекрасно. Пар, свет, эти маленькие подпалины на тарелке. Но эта рука выдаёт всё, и теперь ты уже не можешь этого не видеть.

Инструменты ИИ-картинок прошли большой путь. Поколение назад они размазывали лица и превращали зубы в клавиши пианино. Теперь они создают портрет, который обманывает почти любого. Почти. Остаётся небольшой набор мест, где иллюзия трескается, и как только ты знаешь, куда смотреть, ты видишь их повсюду.

Так вот что происходит на самом деле: почему инструмент, который прекрасно рисует кожу и волосы, всё ещё спотыкается на руке или на уличной вывеске, и что это говорит о том, как эти инструменты ‘видят’.

Признаки, которые всё ещё работают

Некоторые старые подсказки умерли. Пластиковая, отретушированная кожа и эти одинаковые блики в обоих глазах раньше кричали ‘подделка’. Новые модели уже хорошо справляются с текстурой кожи и бликами в глазах, так что сами по себе они больше ничего не значат.

Что всё ещё проскакивает? Горстка мест, где модели нужно удерживать множество мелочей согласованными сразу.

Куда смотретьЧто выдаётПочему так выходит
Руки в действииЛишние или сросшиеся пальцы при захвате, наложении или удержании чего-тоПоза сложная, а детали крошечные, поэтому их прорисовывают последними и хуже всего
Текст на фонеРасплывающиеся буквы на дальней вывеске, корешке книги или этикеткеМодель тратит усилия на объект, а не на мелкий шрифт
Отражения и тениЗеркало, показывающее другое, тени, которые никуда не указываютОна рисует правдоподобное отражение, а не физически верное
Повторяющиеся узорыРяды кирпичей, которые изгибаются, плитки, меняющие размер по кадруДержать математически ровную сетку по всему изображению трудно
Украшения и краяЧасы, наполовину сплавленные с запястьем, кольцо, сливающееся с кожейДве поверхности, чисто соприкасающиеся, это как раз та граница, с которой ей тяжело

Ни одна из них не является безошибочным тестом. Лучшие модели 2026 года способны попасть в любую из них. Хитрость в том, что почти никогда они не попадают во все сразу. У картинки могут быть безупречные руки и читаемый текст, а потом свет идёт с двух сторон, которые не могут существовать вместе.

Почему руки и текст ставят ИИ в тупик

Вот часть, которая удивляет. Модель не рисует руку. Она понятия не имеет, что рука существует.

Питер Бентли, специалист по информатике из University College London, прямо сказал в интервью BBC Science Focus: это ‘генераторы изображений в 2D, у которых нет никакого понятия о трёхмерной геометрии чего-то вроде руки’. Они учатся, впитывая миллионы изображений и улавливая закономерности. У руки обычно есть ладонь, несколько пальцев и несколько ногтей. Но, как говорит Бентли, ‘ни одна из этих моделей на самом деле не понимает, что такое целое’.

Думай об этом не как о художнике, а скорее как об автодополнении для пикселей. Модель предсказывает, что должно идти дальше, исходя из увиденного, ни разу не считая до пяти и не рассуждая, какой палец куда. Попроси две руки с переплетёнными пальцами, и ты можешь получить, по словам Бентли, ‘два запястья и клубок пальцев’. Она угадывает форму, которую видела очень много, но так и не поняла по-настоящему.

Это также объясняет проблему с обучающими данными. На большинстве фото руки это беспорядок. Они наполовину скрыты, сжаты в кулак, машут, держат чашку кофе или повёрнуты так, что видно только два пальца. Лица смотрят прямо в камеру на миллионах чистых снимков, поэтому модели видят лица под любым углом и в любом свете. Руки они видят в основном в разгар движения и наполовину закрытыми, так что расслабленная, раскрытая, обращённая вперёд рука в данных странно редка. Модель становится отличной в том, что видела ясно, и шаткой в том, что видела кусками.

Текст это та же история в другой одежде. Для модели буквы это формы, а не язык. Она знает, что на вывеске должны быть похожие на буквы значки, поэтому рисует похожие на буквы значки. Вблизи, на заголовке, новые модели умеют писать. Отправь это к дальней витрине или к стене мелкого шрифта, и она возвращается к каракулям, которые похожи на слова только издалека.

Что новые модели исправили, а что нет

Было бы нечестно делать вид, что ничего не изменилось. Изменилось многое.

Кожа теперь выглядит настоящей, с порами и зерном вместо того воскового блеска. Глаза совпадают. У лиц есть микровыражения, которые обходят прежнюю скованность зловещей долины. Короткий, заметный текст часто выходит чистым. Простые, покоящиеся руки, те, что просто лежат на коленях, обычно получаются. Если бы ты сегодня увидел топовую картинку без единой подсказки, ты бы не моргнул.

Держится всё, что требует от модели понимать правила, а не копировать внешний вид. Физика это главное. Отражение должно подчиняться геометрии. Тень должна согласовываться со светом. Рука вокруг чашки должна знать, что чашка перед одними пальцами и позади других. Это не проблемы текстуры, это проблемы логики, а искатель закономерностей логикой не занимается. Бентли отмечает, что решение, вероятно, идёт через обучение на настоящих 3D-формах, чтобы модели ‘понимали форму за изображениями’, и ранние работы в этом направлении уже есть, но повседневные инструменты, которыми ты пользуешься, по-прежнему рисуют плоские догадки.

Если тебе любопытно, как далеко продвинулась область именно с проблемой текста, мы разобрали это в ИИ наконец научился писать на картинках. А если ты просто хочешь знать, какой инструмент даёт сегодня самые чистые результаты, мы выстроили их в ряд в лучших генераторах изображений с ИИ.

Как получить ИИ-картинки, которые не выглядят фальшиво

Знание того, почему картинки ломаются, подсказывает, как именно этого избежать. Ты уводишь модель от того, в чём она путается.

Держи руки спокойными или вне кадра. Если руке не нужно делать что-то замысловатое, не заставляй. Попроси руки в покое, в карманах, или просто кадрируй теснее. Портрет от груди и выше обходит всю проблему.

Не проси картинку нести твои слова. Если нужен заголовок, логотип или подпись, добавь их потом в любом графическом редакторе. Пусть модель сделает картинку, а настоящий текст наложи сам сверху. Он выйдет чётким, правильным и твоим.

Опиши свет. Скажи, откуда он. ‘Мягкий свет из окна слева’ даёт модели правило, которому следовать, и тени с отражениями обычно встают на место, а не указывают в случайные стороны.

Генерируй, исправляй, генерируй снова. Первый результат это черновик. Замечай подсказку, подправь промпт или измени одну деталь и запусти ещё раз. Те, кто получает чистые картинки, не везунчики, они просто делают два-три прохода. Здесь помогает работать в одном месте, ведь можно сгенерировать, увидеть расплывшуюся вывеску и запустить снова, не прыгая между приложениями. Тот же приём двигает многие товарные фото, сделанные с ИИ: несколько быстрых проходов, а не один идеальный промпт.

Используй ‘несовершенство’ намеренно. Слегка зернистый, смещённый от центра кадр с настоящим ощущением читается как более достоверный, чем безупречный. Это уже целая эстетика, и мы писали о том, почему фото от ИИ выглядят несовершенными намеренно.

Нет. Лучшие модели 2026 года проходят каждую проверку по отдельности. Надёжный ход это сочетать проверки: смотри сразу на руки, текст на фоне, отражения и повторяющиеся узоры, ведь подделка редко попадает во всё сразу.
Потому что он не понимает руку как объект в 3D. Он предсказывает пиксели по увиденным закономерностям, а на обучающих фото руки встречаются редко и наполовину скрыты, поэтому сложные позы выходят с лишними или сросшимися пальцами.
На самом деле нет. Гладкая кожа и одинаковые блики в глазах уже отработаны хорошо. Смотри лучше на физику: тени, отражения и то, как объекты накладываются друг на друга.
Держи руки простыми или вне кадра, текст добавляй сам потом, опиши, откуда идёт свет, и сделай два-три прохода вместо надежды, что первая попытка будет идеальной.

Честно говоря, дело не в том, что ИИ-картинки плохи. Дело в том, что они уверены в себе, а уверенность это не то же самое, что правота. Потрать тридцать секунд на углы кадра, и ты поймёшь. А потом, когда делаешь свои, можешь нацелить инструмент на то, что ему удаётся, и тихо обойти всё остальное.