Przez rozwój zaawansowanych technologii uczenia maszynowego, możliwości sztucznej inteligencji rosną w zaskakującym tempie. Na przykład, Microsoft stworzył nowatorski model AI, który umożliwia animowanie statycznych obrazów osób.
Obraz może nagle zacząć przemawiać. Model o nazwie Microsoft VASA-1 umożliwia animację portretów ludzi, synchronizując je z nagraniami dźwiękowymi. Rezultaty robią wrażenie, ponieważ zwykłe zdjęcia zmieniają się w realistyczne nagrania osób mówiących lub śpiewających.
Wystarczy zdjęcie, a powstanie realistyczny film
Do swoich eksperymentów Microsoft użył nieistniejących, wygenerowanych portretów z użyciem StyleGAN2 oraz DALL-E 3. Nowa funkcja jest efektywna zarówno na realistycznych zdjęciach ludzi, jak i na bajkowych awatarach. Przedstawiono nawet zastosowanie wizerunku słynnej Mony Lisy.
Model VASA-1 może nie tylko zsynchronizować ruchy warg, ale również oddać bogactwo niuansów mimiki oraz naturalnych ruchów głowy, co znacznie zwiększa realistyczność wygenerowanych animacji.
Nowy model umożliwia tworzenie filmów w rozdzielczości 512 x 512 pikseli z prędkością 45 klatek na sekundę w trybie offline. Może także produkować nagrania online z prędkością do 40 klatek na sekundę przy minimalnym opóźnieniu wynoszącym tylko 170 ms na stacjonarnym komputerze z kartą graficzną NVIDIA GeForce RTX 4090.
Nowa technologia może stanowić zagrożenie
Microsoft podkreśla, że cele badań naukowych skupiają się na generowaniu animacji dla wirtualnych portretów i nie mają na celu tworzenia treści mogących wprowadzać w błąd. Mimo to, firma zdaje sobie sprawę, że technologia ta może być wykorzystana do podszywania się pod inne osoby.
W swoim oświadczeniu, opublikowanym na oficjalnej stronie, firma wyraża sprzeciw wobec wykorzystywania nowego modelu do celów mogących wprowadzać w błąd lub tworzyć szkodliwe treści z wykorzystaniem wizerunków prawdziwych osób. Microsoft nie zamierza udostępnić publicznie wersji demonstracyjnej, interfejsu API ani kompletnego produktu, jednocześnie interesując się wykorzystaniem tej technologii do lepszego wykrywania fałszerstw.