Úvod do problematiky časové syntézy
Generování videa pomocí umělé inteligence představuje v současnosti jeden z nejnáročnějších úkolů v oblasti Computer Vision. Na rozdíl od statických obrazů, které jsou popsány v sekci Generování obrazu a difuzní modely, vyžaduje video udržení kontinuity v čase. Proces zahrnuje predikci následných snímků tak, aby nedocházelo k vizuálním artefaktům nebo logickým rozporům v pohybu objektů. Tento jev se označuje jako zachování temporální koherence.
Současné systémy využívají pokročilé transformery a latentní difuzní modely, které pracují v komprimovaném prostoru. Tím se snižuje výpočetní náročnost, která by při přímé manipulaci s raw pixely ve vysokém rozlišení byla neudržitelná. Mechanismus pozornosti (Self-Attention) umožňuje modelu sledovat vztahy mezi vzdálenými snímky, což je klíčové pro dlouhodobou stabilitu scény. Bez těchto mechanismů dochází k tzv. "plavání" textur, kdy povrchy objektů nepravidelně mění svou strukturu během pohybu.
"Kritickým faktorem pro úspěšnou syntézu videa není jen kvalita jednotlivých snímků, ale stabilita latentního vektoru napříč celou časovou osou sekvence."