Google i DeepMind AI modeli 2026: Gemini 3.8, Gemma 4, Veo, Nano Banana, Robotics, Genie i Alpha sistemi
Google i DeepMind AI modeli 2026: Gemini 3.8, Gemma 4, Veo, Nano Banana, Robotics, Genie i Alpha sistemi

[!NOTE] Aktuelno na dan 22.09.2026. Pregled stanja ekosistema, tehničkih specifikacija i dostupnosti modela kompanija Google i Google DeepMind. Svaka tehnička tvrdnja u ovom vodiču zasnovana je na zvaničnoj Google, Google DeepMind, Google AI for Developers i Vertex AI dokumentaciji.

Ovaj vodič donosi sistematičan pregled najvažnijih aktivnih, javno predstavljenih i najavljenih Google i Google DeepMind AI modela i istraživačkih sistema u 2026. godini.

Veštačka inteligencija u 2026. godini više se ne svodi na jedan izolovani jezički model koji odgovara na tekstualna pitanja. Tehnološki ekosistem Google-a i Google DeepMind-a razgranao se u specijalizovanu mrežu alata: od produkcionih multimodalnih modela za agentske poslove i pisanje koda, preko sistema za glasovnu interakciju i generisanje videa, do otvorenih modela porodice Gemma, embodied inteligencije u robotici i fundamentalnih naučnih proboja u genomici i matematici.


Brzi pregled statusa na dan 22.09.2026.

Da bi se odmah razumela razlika između onoga što možete pozvati kroz produkcioni API i onoga što je laboratorijski eksperiment, svaki sistem u članku nosi preciznu oznaku:

  • [GA / Stable] - Opšte dostupan produkcioni model sa zvaničnom API podrškom i definisanim cenovnikom.
  • [Preview / Experimental] - Model javno dostupan za testiranje i rani razvoj pre pune komercijalne dostupnosti.
  • [Research / Limited Access] - Istraživački sistem demonstriran u naučnim radovima ili model sa pristupom ograničenim na verifikovane partnere.
  • [Confirmed in Development] - Zvanično potvrđen projekat u fazi aktivnog razvoja ili pre-traininga.
  • [Operational / Production] - Model koji Google koristi u operativnim i produkcionim servisima ili javno distribuira kroz platformske podatkovne kanale, ali nije nužno standardni generativni API model sa token-based tarifom.
  • [Legacy / Previous Generation] - Starija generacija modela koja se postepeno zamenjuje novijim izdanjima.

Ključne aktivne linije u septembru 2026:

  • Glavni produkcioni frontier API: Gemini 3.8 Flash, Gemini 3.8 Live (uz Gemini 3.1 Pro u Preview statusu).
  • Specijalizovane i agentske mogućnosti: Gemini 3.8 Flash Cyber, Gemini Computer Use, Deep Research.
  • Multimodalna generacija (Slike / Video / Zvuk): Nano Banana 2 (i Pro / Lite), Veo 3.1, Lyria 3.5, Gemini Omni 1.1 Flash.
  • Otvorene težine (Open-Weight): Gemma 4 porodica (E2B, E4B, 12B, 26B A4B MoE, 31B).
  • Embodied AI i simulacije: Gemini Robotics 2, Gemini Robotics-ER 2, Genie 3, SIMA 2.
  • Nauka, biologija i klima: AlphaFold 3, AlphaGenome i AlphaGenome Atlas, WeatherNext 3, AlphaEarth Foundations, AlphaEvolve.
  • U razvoju: Gemini 3.5 Pro (Coming soon), Gemini 4 (Pre-training faza).

Šta u ovom ekosistemu NIJE klasičan foundation model?

U javnosti se reč „model“ često koristi za sve što izlazi iz AI laboratorija. Da bi pregled bio tehnički tačan, neophodno je razdvojiti bazične modele od platformi, agenata i alata:

  • Google Antigravity: Nije samostalni model, već agent-first razvojna platforma i agent harness (radno okruženje) koja integriše Gemini modele, lokalne alate i terminal.
  • Gemini Computer Use: Nije poseban foundation model, već tool / capability (funkcionalnost vizuelnog upravljanja interfejsom) koju koriste podržani Gemini modeli (primarno Gemini 3.8 Flash).
  • Gemini Deep Research: Nije bazični jezički model, već autonomni istraživački agent koji orkestrira pretragu, ekstrakciju i sintezu.
  • CodeMender: AI security agent za automatizovanu analizu koda i generisanje bezbednosnih zakrpa.
  • AI Co-Scientist: Multi-agent istraživački sistem koji simulira naučne debate i generisanje hipoteza.
  • AlphaEvolve: Evolucioni agentski sistem za otkrivanje novih računarskih algoritama.
  • AlphaFold Server: Web servis i istraživačka platforma koja pruža pristup AlphaFold 3 modelu.
  • Gemma Scope 2: Nije jezički model, već interpretability toolkit (alat za analizu unutrašnjih aktivacija i bezbednosti neuronskih mreža).

Gemini: Glavna frontier porodica modela

Porodica modela Gemini predstavlja primarni API izbor za softverske inženjere i enterprise sisteme kroz Google AI Studio i Google Cloud Vertex AI.

text
                  [GEMINI FRONTIER ARHITEKTURA]
                                │
       ┌────────────────────────┼────────────────────────┐
       ▼                        ▼                        ▼
 [Radni Flash modeli]    [Advanced Reasoning]     [Dugi kontekst / Pro]
  Gemini 3.8 Flash        Gemini 3.1 Deep Think    Gemini 3.1 Pro
  Gemini 3.8 Live         Gemini 3.8 Live Ext.     Gemini 3.5 Pro (Coming soon)
  Gemini 3.5 Flash-Lite   AlphaEvolve (Agent)      Gemini 4 (Pre-training)

Gemini 3.8 Flash [GA / Stable]

Zvanični API identifikator: gemini-3.8-flash. Objavljen 02.09.2026. kao vodeći višenamenski model Flash serije.

  • Zvanična namena: Dugotrajno softversko inženjerstvo (long-horizon software engineering), autonomni agenti, složeni poslovni tokovi rada, višestepeno rezonovanje i multimodalna obrada velikog konteksta.
  • Ulazni kontekstni prozor: 1,048,576 tokena (1M).
  • Maksimalni izlazni limit: 65,536 tokena (64k).
  • Podržani ulazni formati: Tekst, slike, video, audio i PDF dokumenti.
  • Izlazni format: Tekst.
  • Thinking nivoi (podešavanje rezonovanja): Podržani nivoi su low, medium i high (nivo minimal nije podržan).
  • Podržani alati i API funkcije: Caching, Code Execution, File Search, Function Calling, Google Maps Grounding, Google Search Grounding, Structured Outputs (JSON Schema), URL Context i Computer Use podrška.
  • Zvanične cene (Google AI API, stanje septembar 2026):
    • Uvodna tarifa (važi do 31.12.2026): $0.75 po milionu ulaznih tokena; $3.75 po milionu izlaznih tokena.
    • Najavljena standardna tarifa (od 01.01.2027): $1.50 po milionu ulaznih tokena; $7.50 po milionu izlaznih tokena.

Gemini 3.8 Flash Cyber [Research / Limited Access]

Specijalizovana varijanta modela Gemini 3.8 Flash namenjena defanzivnoj informacionoj bezbednosti (cybersecurity).

  • Zvanične mogućnosti: Autonomno pronalaženje bezbednosnih propusta u programskom kodu, automatizovano generisanje i testiranje zakrpa (automated patching) i analiza složenih repozitorijuma na velikom broju programskih jezika.
  • Kanal pristupa: Model nije deo javnog API-ja. Pristup je ograničen na verifikovane bezbednosne stručnjake kroz Google-ov odbrambeni program Fairwind.
  • Opseg primene: Primarno se koristi za defanzivne potrebe. Scenariji poput analize malvera i reverznog inženjeringa predstavljaju praktične načine primene u okviru programa Fairwind, a ne javno specificiran korpus na kome je model treniran.

Gemini 3.8 Live [GA / Stable]

Objavljen 15.09.2026. kao napredno rešenje za dvosmernu glasovnu i multimodalnu interakciju u realnom vremenu uz nisko kašnjenje (low-latency conversational interaction).

  • Arhitektura: Nativna obrada audio-u-audio bez zasebnih međukoraka pretvaranja govora u tekst i teksta u govor.
  • Ulazni kontekst: 131,072 tokena; maksimalni izlaz: 65,536 tokena.
  • Podržani ulazi: Tekst, slike, audio i video tokovno; izlaz generiše tekst i nativni audio.
  • Mogućnosti: Asinhrono pozivanje funkcija (async function calling), vizuelni kontekst sa kamere ili ekrana u realnom vremenu, rezonovanje tokom razgovora i podrška za više od 97 jezika.

Gemini 3.8 Live Extended Thinking [GA / Stable]

Proširena verzija Live modela koja omogućava rešavanje kompleksnijih zadataka tokom glasovne sesije.

  • Funkcionalna namena: Pozadinsko rezonovanje (background reasoning), planiranje složenijih koraka i asinhrono pokretanje alata dok glasovni razgovor sa korisnikom nesmetano teče.
  • Podešavanje: Koristi parametar thinkingLevel (low, medium, high) za balansiranje dubine analize i brzine verbalnog odziva.

Gemini 3.5 Pro [Confirmed in Development]

Model koji Google i DeepMind zvanično vode pod statusom Coming Soon. Prolazi kroz fazu internog i partnerskog testiranja. Na dan 22.09.2026. model nije javno dostupan kao opšti produkcioni API, a zvanični podaci o ceni, tačnom kontekstnom prozoru i merenjima performansi još nisu objavljeni.

Gemini 3.1 Pro [Preview]

Napredni Gemini Pro model trenutno dostupan u Preview statusu, namenjen zahtevnim analitičkim, multimodalnim i programerskim zadacima. Zvanični API identifikator: gemini-3.1-pro-preview.

  • Kontekstni limiti: 1,048,576 ulaznih tokena; 65,536 izlaznih tokena.
  • Praktična primena: Zbog velikog konteksta pogodan je za analizu celih repozitorijuma koda, dugih video i audio snimaka i opsežne tehničke dokumentacije bez potrebe za veštačkim sečenjem na celine.

Gemini 3.1 Deep Think [Preview / Research]

Napredni režim rezonovanja dizajniran za kompleksne probleme u matematici, fizici, hemiji, inženjerstvu i algoritamskom dizajnu koji zahtevaju rigoroznu verifikaciju logičkih međukoraka.

Kontekstni kapacitet prethodnih generacija: Gemini 2.5 serija [Legacy / Stable]

Gemini 2.5 Pro i Gemini 2.5 Flash poseduju standardni ulazni prozor od 1,048,576 tokena (oko 1 milion, ne više miliona). Stariji model Gemini 1.5 Pro je u eksperimentalnoj fazi nudio do 2,097,152 tokena, ali spada u prethodnu generaciju.

Gemini 4 [Confirmed in Development]

Sledeća velika prekretnica u razvoju Google-ovih frontier modela.

  • Zvanično potvrđena činjenica: Google je javno potvrdio da je započeo svoj najambiciozniji pre-training ciklus do sada za model Gemini 4 (most ambitious pre-training run yet).
  • Javno dostupne specifikacije (stanje 22.09.2026): Google do ovog trenutka nije objavio zvanični model card, API identifikator, veličinu konteksta, izlazni limit, cenu, benchmark rezultate niti konačnu arhitekturu.

[!WARNING] Nepotvrđene glasine i nezvanični navodi: Brojke koje kruže po forumima (poput navodnih 10 miliona tokena konteksta, 256K izlaznog limita, trajne memorije među sesijama ili samostalnog izvršnog okruženja) predstavljaju nepotvrđene glasine [UNVERIFIED] i nisu deo zvanične Google dokumentacije.


Gemini Live, Speech i Audio ekosistem

Obrada govora u realnom vremenu prešla je na nativne modele koji zamenjuju nekadašnje višestepene cevovode za transkripciju i sintezu glasa.

ModelStatusPrimarna namenaKljučne mogućnosti
Gemini 3.8 Live[GA / Stable]Dvosmerni razgovor uživoAudio-u-audio, vizuelni kontekst, 131k kontekst, 97+ jezika
Gemini 3.8 Live Extended Thinking[GA / Stable]Glasovni dijalog sa planiranjemPozadinsko rezonovanje dok razgovor teče, asinhroni alati
Gemini 3.5 Transcribe[GA / Stable]Speech-to-Text transkripcijaPrepoznavanje govornika (diarization), timestampovi po rečima
Gemini 3.5 Transcribe Live[GA / Stable]Streaming transkripcija uživoNiska latencija za prenose uživo i konferencije
Gemini 3.5 Live Translate[Preview]Dvosmerno prevođenje govoraReal-time speech-to-speech prevod uz očuvanje intonacije (endpoint: gemini-3.5-live-translate-preview)
Gemini 3.1 Flash TTS[Preview]Sinteza govora (Text-to-Speech)Low-latency speech generation, steerable prompts i expressive audio tags za kontrolu naracije (endpoint: gemini-3.1-flash-tts-preview)
Gemini 2.5 Pro TTS & Flash TTS[Legacy]Stabilna sinteza glasaVišejezička govorna podrška u produkciji

Gemini Omni: Strateški pravac i trenutno stanje

Koncept Gemini Omni Google opisuje kao korak ka dugoročnoj viziji modela koji može da stvara i uređuje različite medijske modalitete iz različitih vrsta ulaza, počevši od videa.

text
Dugoročna vizija (Strateški cilj):        Trenutno stanje (Gemini Omni 1.1 Flash):
[Tekst / Slika / Audio / Video]           [Tekst / Slika / Audio / Video]
               │                                         │
               ▼                                         ▼
      [ Univerzalni Omni ]                     [ Omni 1.1 Flash Engine ]
               │                                         │
               ▼                                         ▼
[Tekst / Slika / Audio / Video]                [High-Res Video sa Nativnim Zvukom]

Gemini Omni 1.1 Flash [Preview / Experimental]

Aktuelna radna implementacija Omni koncepta.

  • Ulazni modaliteti: Tekst, slike, audio i video.
  • Trenutni izlaz: Video visoke rezolucije sa integrisanim audio zapisom.
  • Potvrđene mogućnosti:
    • Generisanje videa iz tekstualnih i slikovnih opisa (video generation).
    • Konverzacijsko uređivanje postojećeg video materijala (conversational video editing).
    • Produžavanje trajanja video kadrova (video extension).
    • Interpolacija među-frejmova (keyframe interpolation).
    • Skaliranje i povećanje rezolucije video zapisa (resolution upscaling).

Modeli za generisanje i obradu slika: Nano Banana / Gemini Image

Linija modela za kreiranje i semantičku izmenu slika pripada Gemini Image ekosistemu, poznatom pod nazivom Nano Banana. Ovi modeli dostupni su kroz Gemini API, Google AI Studio i Vertex AI.

Nano Banana Pro (Gemini Pro Image) [GA / Stable]

Vodeći model za generisanje slika visoke vernosti.

  • Precizno renderovanje teksta: Pouzdano ispisuje etikete, tipografiju, znakove i duže natpise unutar slike.
  • Kompleksni prostorni rasporedi: Prati detaljna uputstva o pozicioniranju objekata u sceni.
  • Semantičko uređivanje: Podržava inpainting i outpainting uz očuvanje postojećeg stila i svetla.

Nano Banana 2 (Gemini Flash Image) [GA / Stable]

Model optimizovan za interaktivne aplikacije gde je brzina ključna. Podržava rad u rezolucijama 0.5K, 1K, 2K i 4K, kontrolu formata slike (aspect ratio), integrisano rezonovanje (Thinking), Search Grounding i korišćenje videa kao multimodalnog konteksta za generisanje slika.

Nano Banana 2 Lite [GA / Stable]

Cenovno najpovoljnija i najbrža varijanta. Reč je o cloud/API modelu optimizovanom za visokofrekventnu upotrebu i brzo interaktivno uređivanje. (Napomena: pojam „local edits“ kod ovog modela označava lokalizovane izmene na određenom delu slike, a ne lokalni on-device inferens na telefonu).

Nano Banana (Gemini 2.5 Flash Image) [Legacy]

Ranija generacija modela (gemini-2.5-flash-image) za koju Google preporučuje migraciju na seriju Nano Banana 2.


Video generacija: Veo 3.1

Porodica modela Veo namenjena je profesionalnom kreiranju pokretnih slika sa visokom vremenskom koherentnošću.

text
[Tekstualni opis ili Polazna slika]
                 │
                 ▼
          [ VEO 3.1 MODEL ]
                 │
      ┌──────────┴──────────┐
      ▼                     ▼
[Video do 4K rezolucije] [Nativni Sinhronizovani Audio]
- Kontrola kamere i pokreta - Ambijent i zvučni efekti
- Temporalna koherentnost   - Poboljšano audio-video poravnanje
- Dodavanje/uklanjanje      - Dijalozi (područje aktivnog razvoja)
  • Veo 3.1 [Preview - Gemini API]: Zvanični API endpoint: veo-3.1-generate-preview (i brza varijanta veo-3.1-fast-generate-preview). Glavni model za Text-to-Video i Image-to-Video. Veo 3.1 podržava 1080p i 4K output za podržane generacije i trajanja (npr. do 8 sekundi). Poseduje ugrađeni sinhronizovani audio (ambijent, zvučni efekti i dijalozi sa poboljšanim vremenskim poravnanjem). Nudi režijsku kontrolu kamere, produžavanje scena (scene extension), kontrolu početnog i krajnjeg frejma (first/last frame control), outpainting i selektivno dodavanje ili uklanjanje objekata iz kadra.
  • Veo 3.1 Lite [Preview - Gemini API]: Zvanični API endpoint: veo-3.1-lite-generate-preview. Brža verzija optimizovana za brzu proveru koncepata i pre-vizuelizaciju.
  • Veo 3 i Veo 2 [Legacy]: Prethodne generacije koje su postavile standarde vremenske konzistentnosti.

Muzika i generisanje zvuka: Lyria ekosistem

Razvijen u saradnji sa muzičkim stvaraocima, sistem Lyria bavi se generisanjem instrumentalnih deonica i pesama.

  • Lyria 3.5 [GA / Stable]: Glavna aktuelna generacija (u stabilnoj fazi od 03.09.2026). Generiše celokupne muzičke numere u stereo tehnici na osnovu tekstualnih ili slikovnih promptova, uz podršku za tekst pesme (lyrics).
  • Lyria 3 Pro [Preview / Legacy]: Prethodno izdanje za studijsko testiranje. (Napomena: višekanalni izvoz instrumenata u demonstracijama bio je deo aplikativnih tokova rada, a ne nativna funkcija samog modela).
  • Lyria 3 Clip [Preview]: Zvanični API endpoint: lyria-3-clip-preview. Model generiše kratke muzičke klipove i petlje (loops) u trajanju do približno 30 sekundi.
  • Lyria RealTime [Preview]: Interaktivni model koji u realnom vremenu dinamički menja muzički tok prateći spoljne događaje (npr. nivo akcije u igrama).
  • Lyria 2 [Legacy]: Starija verzija. Označavanje zvuka vrši se tehnologijom vodenog žiga SynthID, koja je širi Google bezbednosni standard.

Gemma: Porodica modela otvorenih težina (Open-Weight)

Za inženjere i kompanije koje žele samostalno hostovanje na sopstvenim serverima bez slanja podataka spoljnim servisima, Google razvija porodicu otvorenih težina Gemma.

text
                   [ GEMMA 4 PORODICA ]
                             │
       ┌─────────────────────┼─────────────────────┐
       ▼                     ▼                     ▼
 [Edge & Mobile]      [Server Dense]        [MoE Skaliranje]
 Gemma 4 E2B (Edge)    Gemma 4 12B           Gemma 4 26B A4B (MoE)
 Gemma 4 E4B (Edge)    Gemma 4 31B

Gemma 4 serija [GA / Open-Weight]

  • Gemma 4 E2B i E4B: Kontekstni prozor: 128K tokena. Modaliteti: Text, Image, Audio → Text. Optimizovani modeli za energetski efikasan rad na mobilnim uređajima i na ivici mreže (edge devices).
  • Gemma 4 12B: Kontekstni prozor: 256K tokena. Modaliteti: Text, Image, Audio → Text. Model opšte namene za lokalno hostovane sisteme, multimodalnu analizu i programiranje.
  • Gemma 4 26B A4B (MoE): Kontekstni prozor: 256K tokena. Modaliteti: Text, Image → Text. Mixture-of-Experts arhitektura gde se po svakom tokenu aktivira 4 milijarde parametara od ukupno 26 milijardi, što smanjuje utrošak računarskih resursa (compute) tokom inferensa.
  • Gemma 4 31B: Kontekstni prozor: 256K tokena. Modaliteti: Text, Image → Text. Najveći gusti (dense) model otvorenih težina u ovoj liniji, namenjen za složeno rezonovanje i programiranje.

Šira porodica specijalizovanih Gemma modela

  1. FunctionGemma [GA]: Model prilagođen za prepoznavanje formata funkcija i pozivanje eksternih alata.
  2. EmbeddingGemma [GA]: Kompaktan model za lokalno kreiranje semantičkih vektora.
  3. DiffusionGemma [Experimental / Research]: Eksperimentalni model koji istražuje difuzione mehanizme za generisanje teksta umesto autoregresivnih slojeva.
  4. MedGemma & MedGemma 1.5 4B [Research / Open-Weight]: Modeli optimizovani za razumevanje medicinskih tekstova i analizu radioloških snimaka. (Napomena: model nije namenjen za samostalno postavljanje dijagnoza u kliničkoj praksi bez stručne verifikacije lekara).
  5. TranslateGemma [GA]: Specijalizovan za prevođenje teksta na 55 svetskih jezika.
  6. T5Gemma [GA]: Encoder-decoder arhitektura pogodna za ekstrakciju podataka i pretragu.
  7. ShieldGemma & ShieldGemma 2 [GA]: Bezbednosni klasifikatori za filtriranje tekstualnog i multimodalnog sadržaja.
  8. CodeGemma [GA]: Specijalizovan za analizu i generisanje koda.
  9. PaliGemma & PaliGemma 2 [GA]: Vision-Language modeli (VLM) za detekciju objekata i vizuelno odgovaranje na pitanja.
  10. RecurrentGemma [Research]: Hibridna arhitektura bazirana na Griffin mehanizmu sa fiksnom potrošnjom memorije pri radu sa dugim sekvencama.
  11. DolphinGemma [Research]: Naučni model kreiran u saradnji sa biolozima za akustičku analizu i istraživanje komunikacije delfina.
  12. Gemma 3 270M [GA]: Izuzetno mali model za ultra-lake zadatke klasifikacije.
  13. DataGemma [Research]: Povezuje modele sa javnim statističkim podacima putem Data Commons platforme.
  14. TxGemma [Research / Open-Weight]: Otvoreni modeli za rani razvoj lekova (detaljnije u sekciji o biologiji).

Robotika: Gemini Robotics (Embodied AI)

Primena vizuelno-jezičkih modela na kontrolu fizičkih robota odvija se kroz Vision-Language-Action (VLA) arhitekturu.

text
[Kamera i Senzori] ──→ [Gemini Robotics-ER 2] ──→ [Višestepeni Plan]
                             │
                             ▼
               [Gemini Robotics On-Device 2]
                             │
                             ▼
                 [Motori i Manipulatori]
  • Gemini Robotics 2 [Research / Limited Access]: Nativni VLA model za direktnu kontrolu tela i manipulatora robota u fizičkom svetu.
  • Gemini Robotics-ER 2 [Research]: Embodied-Reasoning VLM sa 128K kontekstnim prozorom i 64K izlazom. Analizira tekst, slike, video i audio kako bi izveo prostorno, vremensko i fizičko rezonovanje i dugoročno planiranje zadataka.
  • Gemini Robotics On-Device 2 [Research]: Model za lokalno izvršavanje na robotu bez oslanjanja na internet vezu. U istraživanjima je pokazao sposobnost prilagođavanja novim robotskim konfiguracijama uz manje od 200 demonstracija i nekoliko sati trening podataka.

World Modeli i simulacije: Genie 3 i SIMA 2

Istraživanja usmerena na razumevanje prostornih i fizičkih zakonitosti kroz simulacije:

Genie 3 [Research]

Generalni model sveta (World Model) koji iz tekstualnog opisa ili jedne slike generiše interaktivno 3D okruženje u realnom vremenu (oko 20–24 frejma u sekundi u 720p rezoluciji). Omogućava real-time navigaciju i dinamičke događaje u generisanom prostoru, uz vremensku konzistentnost koja traje nekoliko minuta. Reč je o neuronskom modelu sveta, a ne o klasičnom game engine-u.

SIMA 2 (Scalable Instructable Multiworld Agent) [Research]

Opšti AI agent koji koristi Gemini kao jezgro za rezonovanje. Posmatra svet isključivo preko piksela na ekranu i upravlja standardnim komandama (poput tastature i miša) bez pristupa internom programskom kodu igre. Sposoban je da prati multimodalne instrukcije u potpuno nepoznatim virtuelnim okruženjima i demonstriran je u integraciji sa Genie 3 simulacijama.


Multimodalni vektorski prostor: Gemini Embedding 2

Za sisteme semantičke pretrage i RAG (Retrieval-Augmented Generation) arhitekture:

  • Gemini Embedding 2 [GA / Stable]: Zvanični API identifikator: gemini-embedding-2.
    • Ulaz: Tekst, slike, video, audio i PDF dokumenti.
    • Limit ulaza: 8,192 tokena.
    • Izlazne dimenzije vektora: Fleksibilno od 128 do 3,072 dimenzije.
    • Namena: Semantička pretraga, multimodalno pretraživanje, klasterizacija i unakrsno poređenje različitih medija u jedinstvenom vektorskom prostoru.
  • Gemini Embedding 001 [GA / Stable]: Standardni tekstualni model za tekstualne baze znanja.
  • EmbeddingGemma [GA / Open-Weight]: Otvoreni model za generisanje vektora na lokalnoj infrastrukturi.

Computer Use i Agentski sistemi

Prelazak sa pasivnog odgovaranja na aktivno izvršavanje zadataka u softverskom okruženju:

text
[Zadatak korisnika] ──→ [Gemini 3.8 Flash + Computer Use Tool]
                                │
       ┌────────────────────────┼────────────────────────┐
       ▼                        ▼                        ▼
[Screenshot ekrana]        [Rezonovanje]           [Akcija mišem/tastaturom]
- Prepoznavanje elemenata  - Planiranje sledećeg   - Klik, unos teksta,
- Čitanje tabela/formi       koraka                  pomeranje kursora

Gemini Computer Use capability [Preview]

Funkcionalnost (alat) koja podržanim modelima (preporučeno Gemini 3.8 Flash) omogućava upravljanje grafičkim interfejsom u pretraživaču, mobilnom i desktop okruženju. Radi u petlji: snimak ekrana → planiranje → akcija → verifikacija novog stanja. Poseduje ugrađene bezbednosne mehanizme protiv prompt-injection napada i traži korisničku potvrdu za osetljive radnje. (Nasleđeni prethodni endpoint: gemini-2.5-computer-use-preview-10-2025).

Gemini Deep Research i Deep Research Max [Preview / Agent]

Autonomni istraživački agenti (API endpointi: deep-research-preview-04-2026 i deep-research-max-preview-04-2026). Poseduju 1M kontekst i 65K izlaz. Pretražuju internet, lokalne fajlove (File Search), koriste URL Context, MCP alate i izvršavanje koda kako bi unakrsno analizirali izvore i generisali strukturirane istraživačke izveštaje sa citiranim referencama i grafikonima.

CodeMender [Research / Limited Access - Security Agent]

AI agent za informacionu bezbednost koji kombinuje statičku analizu, dinamičko testiranje, fuzzing, diferencijalno testiranje i SMT rešavače radi automatskog pronalaženja ranjivosti i generisanja zakrpa koje pre integracije prolaze inženjerski pregled.

AI Co-Scientist [Research - Multi-Agent System]

Sistem zasnovan na Gemini modelima koji organizuje saradnju više specijalizovanih agenata. Agenti generišu hipoteze, kritikuju predloge drugih agenata i kroz format naučne debate vrše rangiranje i sintezu istraživačkih ideja.


Biologija, medicina i genomika: Alpha sistemi

DeepMind-ovi sistemi u oblasti prirodnih nauka bave se mapiranjem bioloških struktura i genetskog koda.

text
Biološki nivo:          Sistem:                         Obim predikcija:
[3D Kompleksi]          AlphaFold 3                     Proteini, DNK, RNK, ligandi
[Tačkaste mutacije]     AlphaMissense                   71 milion missense varijanti
[Celokupan genom]       AlphaGenome & Atlas             ~9 milijardi nukleotidnih varijanti
[Terapeutski molekuli]  TxGemma (2B, 9B, 27B)           Mali molekuli, antitela, proteini
[Klinički tekst i slika] MedGemma                       Medicinski NLP i radiologija

AlphaFold 3 [GA / Scientific Access]

Model koji predviđa trodimenzionalne strukture i međusobne interakcije gotovo svih bioloških molekula: proteina, DNK, RNK i liganada (malih molekula ključnih za razvoj lekova).

AlphaGenome i AlphaGenome Atlas [Research]

Jedan od najvećih DeepMind naučnih proboja. AlphaGenome analizira regulatorne sekvence DNK i predviđa uticaj promena u genomu na funkcionisanje ćelije. AlphaGenome Atlas obuhvata predikcije za približno 9 milijardi pojedinačnih promena baza (single-nucleotide variants), što praktično pokriva svaku moguću jednostruku mutaciju u ljudskom genomu. Google DeepMind je objavio istraživačku implementaciju i pre-trenirane AlphaGenome težine (pretrained weights), koje su istraživačima dostupne preko platformi Kaggle i Hugging Face uz prihvatanje posebnih nekomercijalnih uslova licenciranja.

AlphaMissense [Research]

Klasifikovao je približno 71 milion mogućih humanih missense mutacija, od kojih je oko 89% svrstano u kategorije verovatno benignih ili verovatno patogenih, pružajući bazu za istraživanje retkih bolesti.

TxGemma [Research / Open-Weight]

Porodica otvorenih modela (veličina 2B, 9B i 27B) obučena na oko 7 miliona primera za terapeutski razvoj i evaluirana na preko 60 zadataka koji obuhvataju male molekule, proteine, nukleinske kiseline i ćelijske linije.


Vremenska prognoza, klima i Zemlja

AI modeli za modelovanje vremenskih prilika generišu prognoze znatno brže od klasičnih numeričkih metoda i postižu konkurentne ili bolje rezultate na specifičnim meteorološkim benchmarkovima.

  • WeatherNext 3 [Operational / Production]: Koristi direktne satelitske podatke za globalnu prognozu vremena sa ažuriranjem na svakih sat vremena. WeatherNext 3 pruža station-targeted predikcije za temperaturu i tačku rose (dewpoint) na rezoluciji od približno 0.05° (~5 km), dok su standardne gridded surface promenljive poput temperature i vetra dostupne na približno 0.1° (~10 km), u zavisnosti od konkretnog meteorološkog proizvoda i izlaza.
  • GenCast [Research]: Probabilistički difuzioni model koji kreira ansamble prognoza do 15 dana unapred, optimizovan za rano uočavanje ekstremnih vremenskih nepogoda.
  • GraphCast [Research]: Grafovska neuronska mreža koja pravi globalnu desetodnevnu prognozu za manje od jednog minuta na jednom TPU procesoru.
  • NeuralGCM [Research]: Hibridni model koji kombinuje numeričku dinamiku fluida sa mašinskim učenjem za dugoročne klimatske projekcije.
  • AlphaEarth Foundations [Research]: Geoprostorni temeljni model za posmatranje Zemlje. Mapira gigabajte satelitskih snimaka u zajednički 64-dimenzionalni embedding prostor (preko 1.4 biliona prostornih tačaka godišnje) za praćenje promena u vegetaciji, poljoprivredi i vodotokovima.

Matematika, algoritmi i fundamentalna nauka

  • AlphaEvolve [Research]: Evolucioni agentski sistem pogonjen Gemini modelima za otkrivanje novih algoritama. U produkcionom okruženju Google-ovih data centara pronašao je novu heuristiku za Borg raspoređivanje poslova koja je oslobodila približno 0.7% ukupnih Google računarskih resursa (compute).
  • AlphaGeometry 2 i AlphaProof [Research]: Na Međunarodnoj matematičkoj olimpijadi (IMO 2024) ovi sistemi su postigli nivo ekvivalentan srebrnoj medalji (28/42 poena). AlphaProof formalizuje matematičke iskaze u jeziku Lean i samostalno sklapa formalno dokazane korake. Kasnije je na IMO 2025 noviji Gemini Deep Think dosegao nivo zlatne medalje (35/42).
  • FunSearch [Research]: Sistem koji uparuje jezički model sa automatskim evaluatorom radi pronalaženja novih matematičkih rešenja, uspešno primenjen na problem cap set-a i heuristike za pakovanje (online bin packing).

Istorija i arheologija: Aeneas

  • Aeneas [Research]: AI sistem kreiran za proučavanje antičkog pisanog nasleđa, obučen na bazi od preko 176,000 latinskih natpisa.
    • Tačnost restauracije (Top-20): oko 73% za oštećenja do 10 karaktera, odnosno oko 58% kada dužina nedostajućeg teksta nije unapred poznata.
    • Geografsko poreklo: oko 72% tačnosti u lociranju kroz 62 rimske provincije.
    • Datiranje: procena unutar raspona od oko 13 godina u odnosu na istorijski konsenzus.
    • Glavna inovacija: kontekstualizacija i pretraga paralela - povezuje oštećeni natpis sa srodnim istorijskim tekstovima.

Istorijski prekretnički sistemi u igrama (RL)

DeepMind-ovi rani proboji u učenju potkrepljivanjem (Reinforcement Learning):

  • AlphaGo, AlphaGo Zero i AlphaZero [Historical / Research]: Savladali Go, šah i šogi učenjem kroz samostalno igranje.
  • MuZero [Historical / Research]: Učenje strategije i pravila bez prethodnog znanja; u praksi primenjen na YouTube live infrastrukturi uz uštedu od približno 4% bitrate-a pri VP9 video kompresiji.
  • DreamerV3 i Dreamer 4 [Historical / Research]: Učenje preko internog modela sveta; DreamerV3 je prvi agent koji je u igri Minecraft uspeo da pronađe dijamant od nule bez ljudskih demonstracija.

Velika uporedna matrica modela i sistema

Sledeća tabela objedinjuje ključne tehničke karakteristike za sve važne Google i Google DeepMind sisteme u 2026. godini:

Naziv sistemaPorodicaTip sistemaStatusUlazni modalitetiIzlazni modalitetiContext WindowMax OutputModel ID / PristupOpen-Weight?Primarna namena
Gemini 3.8 FlashGeminiFoundation model[GA / Stable]Tekst, slika, video, audio, PDFTekst1,048,57665,536gemini-3.8-flashNeAgenti, coding, enterprise tokovi
Gemini 3.8 Flash CyberGeminiSpecialized cybersecurity model[Limited Access]Kod / security tasks; kompletni javni input modaliteti nisu specificiraniTekst, zakrpeNije javno objavljenoNije javno objavljenoFairwind ProgramNeOtkrivanje ranjivosti i popravke
Gemini 3.8 LiveGemini LiveConversational VLM[GA / Stable]Tekst, slika, audio, videoTekst, Audio131,07265,536gemini-3.8-liveNeDvosmerni govor u realnom vremenu
Gemini 3.1 ProGeminiFoundation model[Preview]Multimodalni (sve)Tekst1,048,57665,536gemini-3.1-pro-previewNeAnaliza velikih repozitorijuma
Gemini 3.1 Deep ThinkGeminiReasoning model[Preview]MultimodalniTekstNije javno specificirano za Deep Think kao zaseban modelNije javno specificiranoNema zaseban javni Gemini API endpoint / Deep Think modeNeFormalna matematika i nauka
Gemini 3.5 ProGeminiFoundation model[In Development]Nije objavljenoNije objavljenoNije objavljenoNije objavljenoComing soonNeSledeći Gemini Pro model; detaljne javne specifikacije još nisu objavljene.
Gemini 4GeminiFrontier model[In Development]Nije objavljenoNije objavljenoNije objavljenoNije objavljenoNije objavljeno / pre-trainingNije objavljenoSledeća Gemini generacija; detalji arhitekture i mogućnosti nisu javno objavljeni.
Gemini Omni 1.1 FlashGemini OmniGenerative multimodal[Preview]Tekst, slika, audio, videoVideo, AudioNije objavljenoVideo segmentigemini-omni-1.1-flashNeVideo generisanje i obrada
Nano Banana ProGemini ImageImage generation[GA / Stable]Text, ImageImage, Text65,53632,768gemini-3-pro-imageNePrecizna tipografija i kompozicije
Nano Banana 2Gemini ImageImage generation[GA / Stable]Text, Image, Video, PDFImage, Text131,07232,768gemini-3.1-flash-imageNeBrzo generisanje uz Thinking
Nano Banana 2 LiteGemini ImageImage generation[GA / Stable]Text, Image, Video, PDFImage, Text65,5364,096gemini-3.1-flash-lite-imageNeEkonomična i brza generacija
Veo 3.1VeoVideo generation[Preview - Gemini API]Tekst, slikeVideo (1080p/4k) + AudioVideo prompt / kadroviVideo klipoviveo-3.1-generate-previewNeText-to-video sa zvukom
Veo 3.1 LiteVeoVideo generation[Preview - Gemini API]Tekst, slikeVideo + AudioVideo promptBrzi klipoviveo-3.1-lite-generate-previewNeBrza provera video ideja
Lyria 3.5LyriaAudio generation[GA / Stable]Tekst, slikeStereo muzikaMuzički promptPuna pesmalyria-3.5 (Gemini API / Vertex AI)NeKomponovanje sa aranžmanom
Lyria 3 ClipLyriaAudio generation[Preview]Tekst, slikeStereo loop/clipMuzički promptDo ~30s kliplyria-3-clip-previewNeKratki muzički loopovi
Gemma 4 (E2B, E4B)GemmaOpen-weight model[GA / Open-Weight]Text, Image, AudioText128KZavisno od alataHugging Face / KaggleDAEfikasno edge izvršavanje
Gemma 4 12BGemmaOpen-weight model[GA / Open-Weight]Text, Image, AudioText256KZavisno od alataHugging Face / OllamaDASamostalno lokalno pokretanje
Gemma 4 26B A4BGemmaMoE model[GA / Open-Weight]Text, ImageText256KZavisno od alataHugging Face / KaggleDAEfikasno MoE izvršavanje
Gemma 4 31BGemmaOpen-weight model[GA / Open-Weight]Text, ImageText256KZavisno od alataHugging Face / OllamaDAGusti model visokih performansi
Gemini Robotics 2RoboticsVLA model[Research / Limited]Senzori, video, govorMotorske akcijeReal-time streamKontrolne komandeIstraživački pristupNeKontrola robotskih manipulatora
Genie 3World ModelsWorld simulation[Research]Tekst, slike3D svet (720p 24fps)Interaktivna sesijaReal-time videoIstraživački pristupNeInteraktivne 3D simulacije sveta
SIMA 2AgentGame / 3D agent[Research]Ekranski pikseli, govorTastatura / miš akcijeVremenski prozorAkcioni koraciIstraživački radoviNeUniverzalni agent za 3D svetove
Gemini Embedding 2EmbeddingsEmbedding model[GA / Stable]Tekst, slika, video, audio, PDFVektori (128-3072)8,192 tokenaVektorski nizgemini-embedding-2NeMultimodalni RAG i pretraga
Deep ResearchAgentiAutonomous research[Preview / Agent]Tekst, dokumenti, URLIstraživački izveštaj1,048,57665,536deep-research-preview-04-2026NeDuboko istraživanje interneta
AlphaFold 3NaukaBiomolecular model[GA / Scientific]Sekvence proteina, DNK, ligandi3D molekulske struktureSekvence biopolimeraPDB/mmCIF koordinateAlphaFold ServerNe (kod javan za nekomercijalno)Predviđanje struktura molekula
AlphaGenomeNaukaGenomic foundation model[Research]DNK regulatorne sekvenceFunkcionalne predikcijeGenomske regijeEfekat varijantiAlphaGenome AtlasDA - ograničene istraživačke težine / nekomercijalna licenca*Predviđanje efekata mutacija
WeatherNext 3VremeWeather model[Operational / Production]Satelitski snimciGlobalna satna prognozaGlobalna mreža0.05° (~5km) / 0.1° (~10km)Google Weather / Earth EngineNeSatna operativna meteorološka prognoza
AlphaEvolveAgentiEvolutionary coding[Research]Programski kod, testoviOptimizovani kodCodebase kontekstNovi algoritamInterno u Google-uNeOtkrivanje novih algoritama

* Google DeepMind je objavio istraživačku implementaciju i pre-trenirane AlphaGenome težine preko platformi Kaggle i Hugging Face uz prihvatanje posebnih nekomercijalnih uslova licenciranja.


Zaključak

Google i Google DeepMind u 2026. godini ne razvijaju jedan monolitan model, već namensku hijerarhiju sistema optimizovanih za različite računarske zahteve:

  • Flash porodica je Google-ova glavna linija optimizovana za kombinaciju brzine, cene i agentskih produkcionih opterećenja.
  • Live i Omni linije transformišu interakciju sa korisnicima ka nativnom govoru i video obradi bez međukoraka.
  • Gemma serija pruža zajednici programera otvorene težine za lokalnu privatnost i samostalnu kontrolu.
  • Alpha sistemi primenjuju specijalizovane AI metode na biologiju, genomiku, matematiku, algoritme, geoprostorne podatke i fundamentalne naučne discipline.

Google je zvanično potvrdio razvoj modela Gemini 4, ali konačna arhitektura i način na koji će objedinjavati postojeće multimodalne, glasovne, agentske i robotičke mogućnosti još nisu javno precizirani.