Bing Image Creator: twórz obrazy za pomocą słów
Bing Image Creator to darmowe narzędzie od Microsoftu oparte na modelu DALL-E 3, które generuje gotowe obrazy graficzne na podstawie wpisanego opisu tekstowego. Użytkownik wpisuje polecenie w oknie czatu, a system w kilkanaście sekund zwraca cztery warianty kwadratowych grafik gotowych do pobrania. Prawda jest zresztą absolutnie taka, że to najszybszy sposób na darmowe testowanie AI bez stawiania własnych serwerów.
Wczoraj o trzeciej nad ranem zderzyłem się z prostym problemem u nas na dziale. Mieliśmy wypuścić post o lokalnej awarii wodociągów na osiedlu Retkinia w Łodzi. Brakowało zdjęcia. Zamiast szukać po stockach, wklepałem komendę do Bing Image Creator. System wypluł cztery wersje pękniętej rury, ale na dwóch woda płynęła pod górę. Zmieniliśmy te zasady na robocie i dopisałem słowo grawitacja. Poszło. I szczerze mówiąc, nikt na produkcji nie zauważył różnicy.
Jak dokładnie działa Bing Image Creator na silniku DALL-E 3?
Pod maską tego generatora siedzi bezpośrednio udostępniony przez OpenAI model dyfuzyjny. Wpisujesz słowa, a maszyna tłumaczy je na wektory i próbuje złożyć z szumu wizualnego coś, co przypomina twój opis. Microsoft zintegrował to ze swoim kontem i wyszukiwarką. Nie musisz instalować żadnych programów na dysku. Wchodzisz na stronę, logujesz się i masz przed sobą puste pole tekstowe. Wpisujesz prompt. Czekasz. Dostajesz obraz. To jest fakt.
Wyrzuciliśmy u nas w firmie płatne subskrypcje Midjourney właśnie z tego powodu. Bing Image Creator daje cztery obrazki za darmo w jednym rzucie. Posiada system tak zwanych boostów, czyli wirtualnych żetonów. Na start dostajesz ich piętnaście. Każde wygenerowanie zżera jeden żeton. Kiedy żetony się skończą, system nadal działa. Po prostu proces generowania grafik zwalnia z kilkunastu sekund do nawet pięciu minut. Zależy jak bardzo obciążone są serwery w danym momencie. Chyba Microsoft planuje to niedługo zablokować na darmowych kontach, ale pewności nie mam bo dokumentacja z wczoraj milczy na ten temat.
Szlag mnie trafia jak czytam tych wszystkich rzekomych ekspertów od promptowania na forach. Sprzedają szkolenia za ciężkie pieniądze, w których uczą wpisywania słowa fotorealistyczny na końcu zdania. Przecież to jest zwykłe naciąganie ludzi na kasę. Siedzisz przed ekranem, wpisujesz komendę i patrzysz co wyjdzie. Jak jest źle, to poprawiasz jedno słowo i klikasz enter jeszcze raz. Nie ma tu żadnej magii ani inżynierii kwantowej. To po prostu metoda prób i błędów aż trafisz w odpowiedni seed. Koniec filozofii.
Czy darmowe generowanie obrazów ma jakieś ukryte limity?
Ograniczenia są bardzo twarde i wbudowane w silnik na sztywno. System filtruje wszystko przez cenzurę od Microsoftu. Wpisujesz prompt i nagle system odrzuca go bo wykrył słowo krew. CHOLERA JASNA, przecież to miał być plakat medyczny o oddawaniu osocza w przychodni. Algorytm tego nie rozumie. Blokuje od razu.
Zablokowane są słowa związane z przemocą, polityką i znanymi osobami. Nie wygenerujesz zdjęcia obecnego prezydenta jedzącego hot doga. System wywali błąd z informacją o naruszeniu zasad. Jeśli będziesz próbować omijać te filtry zbyt często, zablokują ci całe konto Microsoft. Znam dwa takie przypadki z zeszłego tygodnia od chłopaków z zespołu testerów.
Tworzenie skutecznych promptów bez owijania w bawełnę
Słowa kluczowe mają znaczenie. Bing Image Creator najlepiej radzi sobie z językiem angielskim. Rozumie język polski, ale tłumaczy go w locie przez wewnętrzny translator, co często gubi detale. Lepiej pisać prosto. Używaj rzeczowników i czasowników. Wywal przymiotniki, które nic nie wnoszą do obrazu.
Dobrym pomysłem jest trzymanie się stałego schematu opisu. Ja stosuję bardzo prosty układ. Najpierw podmiot, potem otoczenie, na końcu styl graficzny. Zamiast pisać długie wypracowania, rzucam komendę: stary samochód, błotnista droga, deszcz, styl komiksowy. I to działa. DALL-E 3 świetnie rozumie relacje przestrzenne. Możesz napisać, że kot siedzi na lewo od psa. Maszyna to ułoży poprawnie. Starsze modele miały z tym ogromny problem i mieszały obiekty na ekranie.
- Zawsze określ styl. Brak stylu sprawia, że sztuczna inteligencja wybiera domyślny, plastikowy render 3D, który wygląda bardzo tanio. Wpisz chociaż akwarela, szkic ołówkiem albo fotografia analogowa.
- Unikaj abstrakcji. Maszyna nie wie co to znaczy miłość do ojczyzny. Wie za to jak wygląda człowiek trzymający flagę na tle budynku. Pokaż jej konkrety.
- Jeżeli chcesz tekst na obrazku, weź go w cudzysłów. Bing potrafi generować napisy. Zdarzają mu się literówki, ale bez mała prawie osiemdziesiąt procent krótkich słów wychodzi poprawnie za pierwszym razem.
- Kontroluj oświetlenie. Dopisz na końcu poranek, złota godzina albo oświetlenie neonowe. To zmienia całkowicie odbiór wygenerowanej grafiki.
Jakie błędy najczęściej psują wygenerowaną grafikę?
Najgorsza opcja to przeładowanie promptu. Ludzie wrzucają po trzydzieści słów opisujących każdy detal kurtki bohatera. System wtedy głupieje. Skupia się na guzikach, a zapomina wygenerować tło. Trzeba ciąć tekst do kości. Zostaw tylko to, co ma być widoczne.
Drugi błąd to sprzeczne polecenia. Piszesz, że ma być ciemna noc, ale dodajesz, że słońce razi w oczy. Algorytm wypluje dziwną szarą plamę z prześwietleniem na środku. Trzecia sprawa dotyczy proporcji. Bing Image Creator generuje wyłącznie kwadraty w rozdzielczości 1024 na 1024 piksele. Nie wpisuj komend typu panorama albo format pionowy. System i tak przytnie to do kwadratu, ucinając głowy postaciom na brzegach kadru.
Zastanawiacie się zresztą, dlaczego to na produkcji tak wyje na testach po drodze? Sam się nad tym borykałem dzisiaj u siebie we wtorek. Narzędzie ma problem z generowaniem wielu twarzy w tłumie. Im więcej osób na obrazku, tym gorsza jakość detali. Ludzie na dalszym planie mają zniekształcone oczy i dodatkowe palce u rąk. To znany błąd modeli dyfuzyjnych. Obejście tego wymaga wygenerowania pojedynczej postaci i ewentualnego dorobienia tła w innym programie graficznym.
Prawa autorskie i komercyjne wykorzystanie grafik z Binga
To jest bez mała najtrudniejszy temat na rynku. Zgodnie z regulaminem Microsoftu obowiązującym na ten moment, nie możesz używać grafik wygenerowanych w darmowej wersji Bing Image Creator do celów komercyjnych. Zapisy w umowie użytkownika mówią wprost o użytku osobistym. Oznacza to, że nie powinieneś wrzucać tych obrazków na ulotki, z których czerpiesz zyski, ani sprzedawać ich jako własne dzieła w internecie.
Sytuacja zmienia się, jeśli posiadasz płatną subskrypcję Copilot Pro. Wtedy Microsoft udziela licencji na komercyjne użycie. Ale polskie prawo autorskie widzi to zupełnie inaczej. Żeby utwór był chroniony prawem autorskim, musi być w nim widoczne piętno twórcy. Maszyna nie jest człowiekiem. Wpisanie jednego zdania w pole tekstowe nie czyni z ciebie artysty w świetle ustawy. Dlatego obrazy wygenerowane w całości przez sztuczną inteligencję lądują u nas w domenie publicznej. Każdy może wziąć twój obrazek z Binga i użyć go u siebie na blogu. Nie masz podstaw do pozwu.
Kto tak naprawdę jest właścicielem obrazka z AI?
Nikt. I to rodzi ogromne problemy w agencjach reklamowych. Klient zamawia kampanię. Grafiki robi sztuczna inteligencja. Klient płaci fakturę i myśli, że ma obrazki na wyłączność. Miesiąc później konkurencja używa dokładnie tych samych grafik u siebie. Prawnicy rozkładają ręce. Zmieniliśmy te zasady na robocie i teraz każdą wygenerowaną grafikę przepuszczamy przez Photoshopa. Dodajemy wektorowe elementy, modyfikujemy kolory ręcznie, nakładamy filtry. Tworzymy dzieło zależne. Wtedy pojawia się wkład ludzki i możemy to legalnie chronić.
| Funkcja | Bing Image Creator (DALL-E 3) | Midjourney (v6) |
| Cena za dostęp | Darmowy (system żetonów za konto MS) | Płatny abonament miesięczny |
| Rozumienie tekstu | Bardzo wysokie (rozumie długie zdania) | Średnie (wymaga specyficznych słów) |
| Formaty obrazu | Tylko kwadrat (1024×1024) | Dowolne proporcje (16:9, 9:16 itp.) |
| Generowanie napisów | Radzi sobie dobrze z krótkimi słowami | Słabo, często generuje losowe litery |
Moje brutalne testy na produkcji
Spędziłem nad tym silnikiem bite dwa miesiące próbując zastąpić nim pracę zewnętrznych ilustratorów przy projektach dla małych klientów. Wnioski są bardzo ostre. Bing Image Creator sprawdza się rewelacyjnie do robienia szybkich szkiców koncepcyjnych. Kiedy potrzebujesz pokazać zarządowi jak będzie wyglądało stoisko targowe. Wpisujesz stoisko targowe z drewnianymi paletami, zielone rośliny, oświetlenie punktowe. Masz gotowy podgląd w piętnaście sekund.
Problem pojawia się przy poprawkach. DALL-E 3 nie posiada funkcji inpaintingu w podstawowym interfejsie przeglądarkowym. Nie możesz zaznaczyć jednego fragmentu obrazu i powiedzieć zmień ten kubek na czerwony. Musisz wygenerować cały obraz od nowa z nowym promptem. A maszyna za każdym razem tworzy zupełnie nową kompozycję. Tracisz układ, który podobał ci się wcześniej. To kompletnie dyskwalifikuje to narzędzie z zaawansowanej pracy agencyjnej.
Microsoft wprowadził integrację z programem Microsoft Designer, gdzie można trochę edytować te grafiki. Możesz usunąć tło, dodać tekst z normalnej czcionki albo nałożyć filtry. Ale to wciąż prymitywne rozwiązania w porównaniu do warstw w profesjonalnych programach. Dlatego traktujemy Binga jako maszynę do produkcji surowców. Pobieramy plik JPG i resztę roboty wykonujemy ręcznie na własnych stacjach roboczych.
A prawda jest taka. Narzędzie robi dokładnie to, do czego zostało stworzone. Pozwala zwykłemu człowiekowi bez talentu do rysowania przelać myśli na ekran. Działa szybko. Jest darmowe. Zwraca sensowne wyniki niemal za każdym razem, o ile nie przekombinujesz z poleceniem. Przestańcie szukać w tym głębokiej filozofii twórczej i zacznijcie traktować to jak zwykły pędzel w programie graficznym. Sprawdź sam i wpisz dzisiaj wieczorem prostą komendę. Zobaczysz jak szybko pozbędziesz się złudzeń o trudności obsługi tego systemu.
Często zadawane pytania o Bing Image Creator
Czy Bing Image Creator jest całkowicie darmowy?
Tak. Narzędzie wymaga jedynie posiadania darmowego konta Microsoft. Otrzymujesz pulę dziennych boostów przyśpieszających generowanie. Po ich zużyciu nadal możesz tworzyć obrazy, ale czas oczekiwania mocno się wydłuża.
Jakiego języka najlepiej używać w promptach?
Zdecydowanie angielskiego. Choć interfejs obsługuje język polski, wewnętrzne tłumaczenie maszynowe potrafi zgubić kontekst i detale. Angielskie komendy dają o wiele dokładniejsze rezultaty.
Dlaczego system odrzucił mój opis i zablokował generowanie?
Uruchomiły się filtry bezpieczeństwa. Microsoft blokuje słowa związane z brutalnością, seksem, polityką oraz nazwiska znanych osób publicznych. Musisz usunąć kontrowersyjne słowa z promptu i spróbować ponownie.
Czy mogę sprzedawać grafiki wygenerowane w tym narzędziu?
W darmowej wersji regulamin zezwala wyłącznie na użytek osobisty. Do użytku komercyjnego wymagana jest płatna subskrypcja Copilot Pro, choć w Polsce nadal pozostaje nierozwiązana kwestia braku praw autorskich dla grafik z AI.
Jak zmienić rozdzielczość i proporcje obrazu?
Nie da się tego zrobić. Narzędzie generuje wyłącznie kwadratowe obrazy w rozdzielczości 1024×1024 pikseli. Każda próba wymuszenia innego formatu w tekście zostanie zignorowana przez silnik.
Co to są żetony (boosty) i jak je odnowić?
Boosty to wirtualna waluta przyśpieszająca pracę serwera. Odnawiają się automatycznie każdego dnia lub co tydzień w zależności od obciążenia usługi. Można je również dokupić za punkty w programie Microsoft Rewards.
Bibliografia
1. Polska Izba Rzeczników Patentowych – https://pirp.org.pl
2. Urząd Patentowy Rzeczypospolitej Polskiej – https://uprp.gov.pl
3. Ministerstwo Cyfryzacji – https://www.gov.pl/web/cyfryzacja
4. Państwowy Instytut Badawczy NASK – https://www.nask.pl
5. Centrum Mediacji przy Naczelnej Radzie Adwokackiej – https://centrummediacji.nra.pl










