Google DeepMind pokračuje v rychlém tempu inovací v oblasti generativní umělé inteligence. Oficiálně vydaný dokument (Model Card) k novému modelu Nano Banana 2.1 odhaluje významný skok v přesnosti, věrnosti reálným faktům a udržení konzistence při úpravách obrázků. Model vycházející z architektury Gemini 3.6 Flash přináší revoluci do tvorby vizuálního obsahu pro vývojáře, designéry i běžné uživatele.

Co je Nano Banana 2.1 a čím se liší?

Nano Banana 2.1 je nejnovější nativně multimodální model řady Gemini 3, zaměřený na pokročilé generování a komplexní úpravy obrázků ze zadaného textu či vizuálních vstupů. Model dokáže zpracovat multimediální kontext o velikosti až 1 milion tokenů na vstupu a na výstupu generovat jak textové odpovědi (až 64K tokenů), tak přímo finální obrazy.

Základem tohoto modelu je architektura Gemini 3.6 Flash, díky čemuž Nano Banana 2.1 kombinuje extrémní rychlost a efektivitu s vysokým výpočetním výkonem a pokročilým uvažováním (Reasoning/Thinking).

Klíčové novinky: Režim „Thinking“ a nevídaná konzistence

Největším průlomem modelu Nano Banana 2.1 je implementace režimu Thinking (přemýšlení před vygenerováním), který výrazně překonává předchozí generace (např. Gemini 3 Pro Image / „Nano Banana Pro“ i předchozí Nano Banana 2).

V interních i veřejných srovnávacích testech (Elo hodnocení) dosahuje model špičkových výsledků v následujících oblastech:

  • Konzistence postav a produktů: Zásadním problémem AI generátorů byla nemožnost zachovat stejnou tvář či produkt napříč různými scénami. Nano Banana 2.1 v testech Multi-Character Consistency dosahuje skóre 1106 Elo (oproti 978 u předchozí verze).
  • Faktualita a design infografiky: Model dokáže pracovat s reálnými vědomostmi o světě. Tvorba diagramů a infografik vykazuje výrazně vyšší přesnost textu i faktických dat (přesnost infografik vzrostla z 0,179 na 0,521).
  • Úpravy podle skici a maskování (Ink/Mask-Based Editing): Uživatelé mohou jednoduše nakreslit čáru nebo skicu přes obrázek a AI pochopí, jakou změnu v dané oblasti provést.
  • Přesný render textu: Zlepšení se dočkal i text přímo v obrázcích v různých jazycích (i18n Text Rendering), což ocení tvůrci plakátů a marketingových materiálů.

Kde je Nano Banana 2.1 k dispozici?

Google nasazuje model přímo do svého ekosystému. Vývojáři i tvůrci jej najdou v těchto platformách:

  • Pro běžné uživatele: Aplikace Gemini a vyhledávání Google (AI Mode).
  • Pro vývojáře: Google AI Studio, Gemini API a platforma Google Antigravity.
  • Pro firmy a marketing: Google Ads, Google Flow a Google Stitch.

Limity modelu: Na čem DeepMind stále pracuje?

I přes výrazný posun uvádí Google DeepMind ve své zprávě i známé limity, které se snaží dále vylepšovat:

  • Drobné písmo nebo velmi dlouhé odstavce textu mohou být stále občas rozostřené.
  • Při úpravách obrázků může výjimečně dojít k přílišnému „přilnutí“ k původní póze objektu.
  • Vzácně se objevují nepresnosti v prostorové orientaci (např. zaměnění vlevo/vpravo).
  • Znalostní báze modelu má uzávěrku v březnu 2026.

Závěr

Google DeepMind s modelem Nano Banana 2.1 dokazuje, že spojení rychlých vizuálních modelů s funkcí hlubšího uvažování (Thinking) je tou správnou cestou pro AI grafiku. Schopnost udržet konzistenci postav, správně vykreslit text a chápat reálný svět posouvá AI generátory z roviny zábavného nástroje do role profesionálního pomocníka.

Vyzkoušeli jste již nové generativní funkce v ekosystému Gemini, nebo raději sázíte na konkurenční nástroje jako Midjourney či DALL-E? Podělte se s námi o své zkušenosti v diskusi!

Komentáre

Napsat komentář

Vaše e-mailová adresa nebude zveřejněna. Vyžadované informace jsou označeny *

Přihlásit

Registrovat

Obnova hesla

Zadejte uživatelské jméno nebo e-mailovou adresu, e-mailem obdržíte odkaz pro vytvoření nového hesla.