GenMix pomaga trenować AI, gdy brakuje obrazów

Zespół badaczy z University of Melbourne, Mohamed bin Zayed University of Artificial Intelligence i Information Technology University w Lahaur opracował GenMix – metodę rozszerzania zbiorów obrazów dla systemów sztucznej inteligencji. Zamiast tworzyć zdjęcia od zera, GenMix edytuje prawdziwe obrazy, odrzuca warianty zbyt odległe znaczeniowo od oryginału, a następnie łączy wersję pierwotną z przetworzoną i wzorami fraktalnymi.
GenMix zachowuje część prawdziwego obrazu
.Systemy komputerowego widzenia potrzebują opisanych przykładów. W medycynie ich przygotowanie wymaga czasu specjalistów, w fabrykach najważniejsze wady występują rzadko, a w rolnictwie nowych ognisk chorób może jeszcze nie być w lokalnym archiwum zdjęć. Problemu nie rozwiązuje samo dodanie dowolnych obrazów syntetycznych: zniekształcone szczegóły mogą nauczyć klasyfikator błędnych różnic. Pokazuje to szersze ryzyko uczenia modeli na niesprawdzonych treściach generowanych przez AI.
GenMix wykorzystuje wytrenowany wcześniej model InstructPix2Pix. Otrzymuje on prawdziwe zdjęcie i jeden z dziewięciu promptów zmieniających jego globalny wygląd, na przykład porę roku, zachód słońca, aurorę, mozaikę lub styl akwareli. Cechy wersji oryginalnej i edytowanej porównuje DINOv2; wariant pozostaje w zbiorze tylko po przekroczeniu dynamicznego progu podobieństwa. Następnie gładka maska łączy obie wersje, a domieszka wzoru fraktalnego ma zwiększać różnorodność. Filtr ogranicza ryzyko zmiany znaczenia obrazu, ale nie gwarantuje, że każdy zaakceptowany przykład będzie bezbłędny.
Wyniki zależą od zadania
.W pracy opublikowanej w „Expert Systems with Applications” autorzy opisali eksperymenty m.in. na CIFAR-100, ImageNet-1K, Flower102, zbiorach zdjęć ptaków, samochodów i samolotów oraz Office-Home. W teście z zaledwie 10 obrazami każdej klasy Flower102 model ResNet-18 osiągnął z GenMix 76,38 proc. trafności Top-1, wobec 59,14 proc. bez rozszerzania danych i 74,12 proc. z DiffuseMix.
W teście odporności na atak FGSM na CIFAR-100 odsetek błędów spadł z 23,67 do 16,83 proc. To poprawa o 6,84 pkt proc., czyli około 28,9 proc. w ujęciu względnym. Nie każdy wynik był jednak najlepszy: w jednej z dziewięciu konfiguracji klasyfikacji ogólnej DiffuseMix minimalnie wyprzedził GenMix wynikiem 75,23 wobec 75,14 proc. Odrębna analiza szerszej grupy metod dyfuzyjnego rozszerzania danych, która nie obejmowała GenMix, również wskazuje, że nie istnieje rozwiązanie najlepsze dla każdego zadania.
To nie jest system medyczny
.Eksperymenty GenMix przeprowadzono na publicznych benchmarkach, a nie na skanach pacjentów. Choć AI jest intensywnie rozwijana w diagnostyce obrazowej, tej metody nie można jeszcze porównywać z narzędziami przygotowywanymi bezpośrednio dla radiologii. Zastosowanie kliniczne wymagałoby osobnej walidacji i odpowiednich dopuszczeń.
Autorzy wskazują też zależność rezultatów od jakości promptów oraz dodatkowy koszt obliczeniowy edycji obrazów. Chcą przyspieszyć metodę i sprawdzić ją w obrazowaniu medycznym, monitoringu środowiska oraz systemach związanych z bezpieczeństwem. Kod został publicznie udostępniony w serwisie GitHub.
Szymon Ślubowski



