Генератар відэа, частка 7: як я правяраю, ці мадэль захоўвае героя
Два чалавекі выходзяць з пякарні. Адзін перадае другому круасан, абодва смяюцца. Я гляджу на гэта ўжо каторы раз і правяраю, ці не зніклі акуляры.
Так выглядае адзін з працоўных эксперыментаў у Vini Studio. Збоку можна падумаць, што я проста генерую мілыя мульцікі. Мульцікі мне таксама падабаюцца. Але цяпер мяне цікавіць цалкам канкрэтная рэч: ці застанецца персанаж сабой, калі карцінка пачне рухацца.
У пятай частцы я пісаў пра рэферэнсы герояў і прадметаў, а ў шостай паказваў, як з гэтага збіраецца студыя. За такімі зменамі стаіць менш заўважная праца: прыдумаць праверку, атрымаць вынік і разабрацца, што ён дазваляе сцвярджаць. Часам даводзіцца закрэсліць уласнае тлумачэнне.
Міра, Бо і адзін круасан
Для доследу ўзяў двух дарослых выдуманых герояў. У Міры рыжая каса, круглыя акуляры і жоўты плашч. Бо ніжэйшы ростам, з барадой, у чырвонай шапцы і зялёным швэдры. Іх цяжка пераблытаць нават на невялікай мініяцюры.

Міра. На адным аркушы сабраныя ракурсы і прыкметы, па якіх я пазнаю яе ў наступных кадрах.

Бо. Аранжавыя кеды зручныя яшчэ і для праверкі: іх добра відаць на агульным плане.
Сюжэт наўмысна просты. Мне трэба ўбачыць, як героі ідуць побач і перадаюць прадмет. Калі адразу адправіць іх ратаваць галактыку, будзе цяжэй зразумець, у які момант усё зламалася.
Пры гэтым нават у такой сцэны хапае ўмоў. У кадры павінны застацца менавіта гэтыя двое. Круасан павінен перайсці з адной рукі ў другую. Знешнасць трэба захаваць у руху, а не толькі на першым прыгожым кадры.
Адзін з вынікаў Gemini Omni Flash. Глядзіце на герояў падчас руху і перадачы круасана. Надпісы на пякарні таксама варта заўважыць: да іх яшчэ вернемся.
Спачатку вырашаю, што менавіта правяраю
«Мадэль добра робіць відэа» — занадта шырокае сцвярджэнне для працоўнага рашэння. Мне патрэбнае пытанне, на якое можна адказаць, паглядзеўшы вынік.
Таму я падзяліў задачы. У адным доследзе героі павінны з’явіцца ў новай сцэне на аснове сваіх выяў. У другім трэба замяніць персанажа ў гатовым відэа, захаваўшы тое, што адбываецца навокал. Асобна праверыў стварэнне першага кадра: памылка на гэтым этапе можа перайсці далей у ролік.
Гэта розныя праверкі. Добры пачатковы кадр яшчэ не паказвае, што будзе з тварам пры павароце галавы. А паспяховая замена чалавека ў гатовым відэа сама па сабе нічога не кажа пра тое, як мадэль прыдумае рух з нуля.

Зыходны ролік для праверкі замены: па вуліцы ідзе манекен. Кадры размешчаныя ў часавым парадку злева направа.

Вынік Kling O3: замест манекена ідзе Міра. Цяпер можна асобна параўнаць яе знешнасць і тое, наколькі захаваліся вуліца і рух. У гэтым прагоне замена атрымалася: вуліца пазнавальная, Міра ідзе да камеры так, як у зыходным роліку.
У параўнання ёсць яшчэ адна тонкасць: аднолькавая задача не заўсёды азначае аднолькавы запыт. Розныя мадэлі па-рознаму прымаюць выявы. Я правяраў і бягучую зборку студыі, і варыянты паводле дакументацыі вытворцаў. Калі адрозніваюцца адразу некалькі ўмоў, такі дослед дапамагае праверыць увесь спосаб працы, але не дазваляе прыпісаць вынік адной удалай фармулёўцы.
Што атрымалася ў розных мадэляў
Вось некалькі назіранняў з гэтых прагонаў. На адной сцэне добра відаць, як пазнавальнасць героя і выкананне задання могуць разысціся.
Grok і Gemini: герояў пазнаеш
Grok Imagine 1.5 захаваў Міру і Бо: абодвух пазнаеш з першага кадра, а аркушы з ракурсамі не ператварыліся ў частку дэкарацый. Для мяне гэта ўжо карысны вынік. Можна пазнаць касу Міры, акуляры, адзенне Бо і пры гэтым глядзець на звычайную сцэну каля пякарні.

Grok Imagine 1.5. Круасан пераходзіць да Міры, героі застаюцца пазнавальнымі на працягу сцэны. Шыльду мадэль таксама намалявала — гэты вынік не выканаў усіх умоў задання.
У Gemini Omni Flash у роліку вышэй таксама атрымалася перадача круасана. Мне падабаецца, што тут можна праверыць дзеянне цалкам: прадмет быў у Бо, апынуўся ў Міры, абодва адрэагавалі. Але надпісы на пякарні з’явіліся і ў гэтым варыянце. З захаваннем герояў абодва прыклады ўдалыя, а патрабаванне да тэксту на экране ўсё роўна давялося адзначаць асобна.
Wan і HappyHorse: хто трапіў у кадр
У адным з варыянтаў Wan 3.0 Міра і Бо засталіся пазнавальнымі, затое пад канец камера наблізілася настолькі, што перастала змяшчаць іх цалкам. Глядзіш на твары — усё знаёмае. Глядзіш на пастаноўку — яна ўжо змянілася. Калі прыгледзецца, Бо ў гэтых кадрах яшчэ і выглядае вышэйшым за Міру, хоць у зыходных рэферэнсах ён ніжэйшы.
Wan 3.0, адзін з варыянтаў доследу. Паглядзіце на апошнія секунды: Міра і Бо пазнавальныя, але камера пакідае за краем кадра ўсё большую частку іх фігур.
У HappyHorse 1.1 іншая невялікая вольнасць: у адным роліку Бо спачатку часткова схаваны дзвярыма, у другім Міра затрымліваецца за дзвярыма. Для звычайнай сцэны выхад па чарзе цалкам натуральны. Але ў маім заданні абодва павінны былі быць бачныя з самага пачатку. Такая памылка лёгка губляецца за прыемнай анімацыяй.
Seedance: ролік яшчэ не пачаўся, а праверка ўжо скончылася
Seedance 2.0 Fast і 2.5 адхілілі аркуш Міры: фільтр паведаміў, што на выяве можа быць рэальны чалавек. Пры гэтым Міра выдуманая, а аркуш Бо праверку прайшоў. Крыўдна: я збіраўся глядзець, як гераіня рухаецца, і нават да гэтага не дайшоў.
З іншымі варыянтамі ўваходных выяў абедзве мадэлі далі ролікі з пазнавальнымі героямі. Таму адмову я запісваю асобна ад якасці генерацыі. Яна паказвае праблему з прыёмам канкрэтнага матэрыялу; пра рух у неіснуючым роліку меркаваць няма з чаго.
Пазнаць героя недастаткова
У першых выніках было шмат прыемнага: персанажы пазнавальныя, адзенне падобнае, сцэна выглядае жывой. Тут лёгка паставіць птушачку і пайсці далей.
Але вось асобны вынік стварэння першага кадра на Nano Banana 2:

Nano Banana 2. Героі на месцы. Надпісы таксама, хоць у заданні іх прасілі не маляваць. Пазнавальнасць персанажаў і выкананне абмежаванняў тут далі розныя вынікі.
Мне самому падабаецца гэтая карцінка. Менавіта таму карысна загадзя запісаць, што я збіраюся правяраць. Інакш пасля генерацыі вельмі лёгка вырашыць, што шыльды нават упрыгожваюць сцэну, і незаўважна змяніць крытэрый пад вынік, які спадабаўся.
А вось першы кадр з іншага прагону, на GPT Image 2.5:

GPT Image 2.5. Героі размясціліся інакш: Бо злева, Міра справа. У гэтым варыянце задання бакі не задаваліся, таму такую перастаноўку я не лічу памылкай.
Гэтая пара мне падабаецца яшчэ і як праверка ўласнай ацэнкі. Надпіс, які забаранілі, — парушэнне. Становішча персанажа, якое я толькі ўяўляў сабе, але не пазначыў, мадэль адгадваць не абавязаная. Калі змяшаць гэтыя рэчы, параўнанне хутка ператвараецца ў конкурс супадзенняў з маёй карцінкай у галаве.
У даследчыкаў падобны падзел ёсць у VBench: нязменнасць знешнасці героя, плаўнасць і інтэнсіўнасць руху ацэньваюцца асобна. Мае прыклады не праходзілі гэты бенчмарк; тут мне карысная сама пастаноўка задачы.
Ёсць і адваротная пастка. Можна так захапіцца захаваннем знешнасці, што перастаць заўважаць слабы рух. У працы ConsistI2V аўтары адзначаюць, што іх метад часам дае невялікую амплітуду руху. Гэта абмежаванне канкрэтнага метаду, але добрая нагода глядзець на дзеянне, калі правяраеш, ці застаецца герой сабой. Для маёй сцэны мала захаваць акуляры Міры. Круасан усё ж павінен змяніць уладальніка.
Самая карысная частка — калі гіпотэза не пацвярджаецца
На акуратнай сцэне з Мірай і Бо шмат што працавала. А ў працоўным праекце раней з’яўляліся зусім іншыя вынікі: выявы-рэферэнсы ператвараліся ва ўстаўкі ўнутры роліка, узнікалі лішнія персанажы. З’явілася спакуса спісаць гэта на выпадковую няўдалую генерацыю.
Я паспрабаваў узнавіць збой. На тэставых героях асобныя змены ўмоў яго не вярнулі. Затое пры паўторы працоўнага запыту з яго зыходнымі матэрыяламі характэрныя памылкі з’явіліся зноў. Умовы супадалі не цалкам: у адной з праверак выкарыстоўвалася іншае разрозненне. Але цяпер у мяне быў прыклад, на якім можна правяраць тлумачэнні.
Першае тлумачэнне выглядала пераканаўча: праблема ў зыходных выявах. Далей я змяніў іх падачу і атрымаў непрыемны адказ. Частка дэфектаў знікла, іншыя засталіся ці змяніліся новымі. Зарана я вырашыў, што разабраўся.
Наступныя доследы паказалі, што трэба ўлічваць і апісанне сцэны, і візуальныя ўваходныя даныя. Іх спалучэнне аказалася важнейшым, чым меркавала першая версія тлумачэння. Для мяне тут важны момант, калі наступная праверка прымусіла перагледзець выснову.
Так я і разумею навуковы падыход у сваёй працы. Спачатку ёсць назіранне і меркаваная прычына. Потым трэба прыдумаць дослед, у якім гэтае тлумачэнне можа не спрацаваць, і сапраўды яго правесці. Калі вынік нязручны, ён усё роўна застаецца ў запісах.
Стараюся змяняць па адной умове там, дзе гэта магчыма. Калі змяняю некалькі ўмоў адразу, адзначаю гэта асобна. І нават акуратнае параўнанне адзінкавых генерацый лічу падказкай для наступнага доследу: выпадковасць нікуды не знікае.
Чаго гэтая праверка пакуль не даказвае
У асноўнай матрыцы быў адзін прагон на спалучэнне ўмоў. Гэтага хапіла, каб убачыць працоўныя варыянты і знайсці праблемы для далейшай праверкі. Частату памылак так не вымераць.
Калі персанаж захаваўся адзін раз, я ведаю, што такі вынік атрымаўся. Я яшчэ не ведаю, колькі спроб спатрэбіцца ў наступным праекце. Нават паўторны збой не дае права абвясціць мадэль непрыдатнай для ўсіх сцэн.
Да таго ж асноўная праверка тут на стылізаваных дарослых героях і кароткіх сцэнах. Частка варыянтаў засталася без запуску. Высновы пра доўгі эпізод ці іншы візуальны стыль запатрабуюць сваіх прыкладаў і паўтораў.
Для наступнага этапу мне патрэбныя серыі прагонаў на некалькіх сцэнах. Хочацца зразумець, як часта даводзіцца перарабляць вынік і якія памылкі вяртаюцца пасля змен. Карцінкі ў гэтым артыкуле паказваюць, што атрымалася ў асобных доследах; ацэнку надзейнасці яшчэ трэба атрымаць.
Што з гэтага трапляе ў студыю
Для распрацоўкі такая праверка ўжо карысная. Пасля яе больш зразумела, дзе шукаць праблему і які прыклад узяць, каб праверыць будучае выпраўленне. Часам высвятляецца, што трэба дакладней апісаць задачу. Часам даводзіцца разбірацца, як студыя перадала матэрыялы мадэлі. Пераключэнне на іншую мадэль само па сабе гэтага пытання не здымае.
У першай частцы цыкла я падобным чынам разбіраўся са сцэнарыстам. Цяпер замест тэксту перада мной героі з круасанам, але звычка тая самая: захаваць уваходныя даныя і вынік, каб потым можна было вярнуцца да ўласнай высновы і праверыць яе.
Мне падабаецца, што гэтая праца пакідае пасля сябе яшчэ і такія карцінкі. Бо можна разглядаць проста таму, што ён сімпатычны. А потым уключыць ролік яшчэ раз і заўважыць памылку, якую прапусціў за першым уражаннем.