Sveobuhvatan i tehnički verifikovan pregled aktuelnih Google i Google DeepMind AI modela u 2026. godini: od Gemini 3.8 Flash i Live modela, preko Nano Banana 2 i Veo 3.1, do Gemma 4 otvorenih modela, humanoidne robotike i Alpha biologije.

[!NOTE] Aktuelno na dan 22.09.2026. Pregled stanja ekosistema, tehničkih specifikacija i dostupnosti modela kompanija Google i Google DeepMind. Svaka tehnička tvrdnja u ovom vodiču zasnovana je na zvaničnoj Google, Google DeepMind, Google AI for Developers i Vertex AI dokumentaciji.
Ovaj vodič donosi sistematičan pregled najvažnijih aktivnih, javno predstavljenih i najavljenih Google i Google DeepMind AI modela i istraživačkih sistema u 2026. godini.
Veštačka inteligencija u 2026. godini više se ne svodi na jedan izolovani jezički model koji odgovara na tekstualna pitanja. Tehnološki ekosistem Google-a i Google DeepMind-a razgranao se u specijalizovanu mrežu alata: od produkcionih multimodalnih modela za agentske poslove i pisanje koda, preko sistema za glasovnu interakciju i generisanje videa, do otvorenih modela porodice Gemma, embodied inteligencije u robotici i fundamentalnih naučnih proboja u genomici i matematici.
Brzi pregled statusa na dan 22.09.2026.
Da bi se odmah razumela razlika između onoga što možete pozvati kroz produkcioni API i onoga što je laboratorijski eksperiment, svaki sistem u članku nosi preciznu oznaku:
- [GA / Stable] - Opšte dostupan produkcioni model sa zvaničnom API podrškom i definisanim cenovnikom.
- [Preview / Experimental] - Model javno dostupan za testiranje i rani razvoj pre pune komercijalne dostupnosti.
- [Research / Limited Access] - Istraživački sistem demonstriran u naučnim radovima ili model sa pristupom ograničenim na verifikovane partnere.
- [Confirmed in Development] - Zvanično potvrđen projekat u fazi aktivnog razvoja ili pre-traininga.
- [Operational / Production] - Model koji Google koristi u operativnim i produkcionim servisima ili javno distribuira kroz platformske podatkovne kanale, ali nije nužno standardni generativni API model sa token-based tarifom.
- [Legacy / Previous Generation] - Starija generacija modela koja se postepeno zamenjuje novijim izdanjima.
Ključne aktivne linije u septembru 2026:
- Glavni produkcioni frontier API: Gemini 3.8 Flash, Gemini 3.8 Live (uz Gemini 3.1 Pro u Preview statusu).
- Specijalizovane i agentske mogućnosti: Gemini 3.8 Flash Cyber, Gemini Computer Use, Deep Research.
- Multimodalna generacija (Slike / Video / Zvuk): Nano Banana 2 (i Pro / Lite), Veo 3.1, Lyria 3.5, Gemini Omni 1.1 Flash.
- Otvorene težine (Open-Weight): Gemma 4 porodica (E2B, E4B, 12B, 26B A4B MoE, 31B).
- Embodied AI i simulacije: Gemini Robotics 2, Gemini Robotics-ER 2, Genie 3, SIMA 2.
- Nauka, biologija i klima: AlphaFold 3, AlphaGenome i AlphaGenome Atlas, WeatherNext 3, AlphaEarth Foundations, AlphaEvolve.
- U razvoju: Gemini 3.5 Pro (Coming soon), Gemini 4 (Pre-training faza).
Šta u ovom ekosistemu NIJE klasičan foundation model?
U javnosti se reč „model“ često koristi za sve što izlazi iz AI laboratorija. Da bi pregled bio tehnički tačan, neophodno je razdvojiti bazične modele od platformi, agenata i alata:
- Google Antigravity: Nije samostalni model, već agent-first razvojna platforma i agent harness (radno okruženje) koja integriše Gemini modele, lokalne alate i terminal.
- Gemini Computer Use: Nije poseban foundation model, već tool / capability (funkcionalnost vizuelnog upravljanja interfejsom) koju koriste podržani Gemini modeli (primarno Gemini 3.8 Flash).
- Gemini Deep Research: Nije bazični jezički model, već autonomni istraživački agent koji orkestrira pretragu, ekstrakciju i sintezu.
- CodeMender: AI security agent za automatizovanu analizu koda i generisanje bezbednosnih zakrpa.
- AI Co-Scientist: Multi-agent istraživački sistem koji simulira naučne debate i generisanje hipoteza.
- AlphaEvolve: Evolucioni agentski sistem za otkrivanje novih računarskih algoritama.
- AlphaFold Server: Web servis i istraživačka platforma koja pruža pristup AlphaFold 3 modelu.
- Gemma Scope 2: Nije jezički model, već interpretability toolkit (alat za analizu unutrašnjih aktivacija i bezbednosti neuronskih mreža).
Gemini: Glavna frontier porodica modela
Porodica modela Gemini predstavlja primarni API izbor za softverske inženjere i enterprise sisteme kroz Google AI Studio i Google Cloud Vertex AI.
[GEMINI FRONTIER ARHITEKTURA]
│
┌────────────────────────┼────────────────────────┐
▼ ▼ ▼
[Radni Flash modeli] [Advanced Reasoning] [Dugi kontekst / Pro]
Gemini 3.8 Flash Gemini 3.1 Deep Think Gemini 3.1 Pro
Gemini 3.8 Live Gemini 3.8 Live Ext. Gemini 3.5 Pro (Coming soon)
Gemini 3.5 Flash-Lite AlphaEvolve (Agent) Gemini 4 (Pre-training)
Gemini 3.8 Flash [GA / Stable]
Zvanični API identifikator: gemini-3.8-flash. Objavljen 02.09.2026. kao vodeći višenamenski model Flash serije.
- Zvanična namena: Dugotrajno softversko inženjerstvo (long-horizon software engineering), autonomni agenti, složeni poslovni tokovi rada, višestepeno rezonovanje i multimodalna obrada velikog konteksta.
- Ulazni kontekstni prozor: 1,048,576 tokena (1M).
- Maksimalni izlazni limit: 65,536 tokena (64k).
- Podržani ulazni formati: Tekst, slike, video, audio i PDF dokumenti.
- Izlazni format: Tekst.
- Thinking nivoi (podešavanje rezonovanja): Podržani nivoi su
low,mediumihigh(nivominimalnije podržan). - Podržani alati i API funkcije: Caching, Code Execution, File Search, Function Calling, Google Maps Grounding, Google Search Grounding, Structured Outputs (JSON Schema), URL Context i Computer Use podrška.
- Zvanične cene (Google AI API, stanje septembar 2026):
- Uvodna tarifa (važi do 31.12.2026): $0.75 po milionu ulaznih tokena; $3.75 po milionu izlaznih tokena.
- Najavljena standardna tarifa (od 01.01.2027): $1.50 po milionu ulaznih tokena; $7.50 po milionu izlaznih tokena.
Gemini 3.8 Flash Cyber [Research / Limited Access]
Specijalizovana varijanta modela Gemini 3.8 Flash namenjena defanzivnoj informacionoj bezbednosti (cybersecurity).
- Zvanične mogućnosti: Autonomno pronalaženje bezbednosnih propusta u programskom kodu, automatizovano generisanje i testiranje zakrpa (automated patching) i analiza složenih repozitorijuma na velikom broju programskih jezika.
- Kanal pristupa: Model nije deo javnog API-ja. Pristup je ograničen na verifikovane bezbednosne stručnjake kroz Google-ov odbrambeni program Fairwind.
- Opseg primene: Primarno se koristi za defanzivne potrebe. Scenariji poput analize malvera i reverznog inženjeringa predstavljaju praktične načine primene u okviru programa Fairwind, a ne javno specificiran korpus na kome je model treniran.
Gemini 3.8 Live [GA / Stable]
Objavljen 15.09.2026. kao napredno rešenje za dvosmernu glasovnu i multimodalnu interakciju u realnom vremenu uz nisko kašnjenje (low-latency conversational interaction).
- Arhitektura: Nativna obrada audio-u-audio bez zasebnih međukoraka pretvaranja govora u tekst i teksta u govor.
- Ulazni kontekst: 131,072 tokena; maksimalni izlaz: 65,536 tokena.
- Podržani ulazi: Tekst, slike, audio i video tokovno; izlaz generiše tekst i nativni audio.
- Mogućnosti: Asinhrono pozivanje funkcija (async function calling), vizuelni kontekst sa kamere ili ekrana u realnom vremenu, rezonovanje tokom razgovora i podrška za više od 97 jezika.
Gemini 3.8 Live Extended Thinking [GA / Stable]
Proširena verzija Live modela koja omogućava rešavanje kompleksnijih zadataka tokom glasovne sesije.
- Funkcionalna namena: Pozadinsko rezonovanje (background reasoning), planiranje složenijih koraka i asinhrono pokretanje alata dok glasovni razgovor sa korisnikom nesmetano teče.
- Podešavanje: Koristi parametar
thinkingLevel(low,medium,high) za balansiranje dubine analize i brzine verbalnog odziva.
Gemini 3.5 Pro [Confirmed in Development]
Model koji Google i DeepMind zvanično vode pod statusom Coming Soon. Prolazi kroz fazu internog i partnerskog testiranja. Na dan 22.09.2026. model nije javno dostupan kao opšti produkcioni API, a zvanični podaci o ceni, tačnom kontekstnom prozoru i merenjima performansi još nisu objavljeni.
Gemini 3.1 Pro [Preview]
Napredni Gemini Pro model trenutno dostupan u Preview statusu, namenjen zahtevnim analitičkim, multimodalnim i programerskim zadacima. Zvanični API identifikator: gemini-3.1-pro-preview.
- Kontekstni limiti: 1,048,576 ulaznih tokena; 65,536 izlaznih tokena.
- Praktična primena: Zbog velikog konteksta pogodan je za analizu celih repozitorijuma koda, dugih video i audio snimaka i opsežne tehničke dokumentacije bez potrebe za veštačkim sečenjem na celine.
Gemini 3.1 Deep Think [Preview / Research]
Napredni režim rezonovanja dizajniran za kompleksne probleme u matematici, fizici, hemiji, inženjerstvu i algoritamskom dizajnu koji zahtevaju rigoroznu verifikaciju logičkih međukoraka.
Kontekstni kapacitet prethodnih generacija: Gemini 2.5 serija [Legacy / Stable]
Gemini 2.5 Pro i Gemini 2.5 Flash poseduju standardni ulazni prozor od 1,048,576 tokena (oko 1 milion, ne više miliona). Stariji model Gemini 1.5 Pro je u eksperimentalnoj fazi nudio do 2,097,152 tokena, ali spada u prethodnu generaciju.
Gemini 4 [Confirmed in Development]
Sledeća velika prekretnica u razvoju Google-ovih frontier modela.
- Zvanično potvrđena činjenica: Google je javno potvrdio da je započeo svoj najambiciozniji pre-training ciklus do sada za model Gemini 4 (most ambitious pre-training run yet).
- Javno dostupne specifikacije (stanje 22.09.2026): Google do ovog trenutka nije objavio zvanični model card, API identifikator, veličinu konteksta, izlazni limit, cenu, benchmark rezultate niti konačnu arhitekturu.
[!WARNING] Nepotvrđene glasine i nezvanični navodi: Brojke koje kruže po forumima (poput navodnih 10 miliona tokena konteksta, 256K izlaznog limita, trajne memorije među sesijama ili samostalnog izvršnog okruženja) predstavljaju nepotvrđene glasine [UNVERIFIED] i nisu deo zvanične Google dokumentacije.
Gemini Live, Speech i Audio ekosistem
Obrada govora u realnom vremenu prešla je na nativne modele koji zamenjuju nekadašnje višestepene cevovode za transkripciju i sintezu glasa.
| Model | Status | Primarna namena | Ključne mogućnosti |
|---|---|---|---|
| Gemini 3.8 Live | [GA / Stable] | Dvosmerni razgovor uživo | Audio-u-audio, vizuelni kontekst, 131k kontekst, 97+ jezika |
| Gemini 3.8 Live Extended Thinking | [GA / Stable] | Glasovni dijalog sa planiranjem | Pozadinsko rezonovanje dok razgovor teče, asinhroni alati |
| Gemini 3.5 Transcribe | [GA / Stable] | Speech-to-Text transkripcija | Prepoznavanje govornika (diarization), timestampovi po rečima |
| Gemini 3.5 Transcribe Live | [GA / Stable] | Streaming transkripcija uživo | Niska latencija za prenose uživo i konferencije |
| Gemini 3.5 Live Translate | [Preview] | Dvosmerno prevođenje govora | Real-time speech-to-speech prevod uz očuvanje intonacije (endpoint: gemini-3.5-live-translate-preview) |
| Gemini 3.1 Flash TTS | [Preview] | Sinteza govora (Text-to-Speech) | Low-latency speech generation, steerable prompts i expressive audio tags za kontrolu naracije (endpoint: gemini-3.1-flash-tts-preview) |
| Gemini 2.5 Pro TTS & Flash TTS | [Legacy] | Stabilna sinteza glasa | Višejezička govorna podrška u produkciji |
Gemini Omni: Strateški pravac i trenutno stanje
Koncept Gemini Omni Google opisuje kao korak ka dugoročnoj viziji modela koji može da stvara i uređuje različite medijske modalitete iz različitih vrsta ulaza, počevši od videa.
Dugoročna vizija (Strateški cilj): Trenutno stanje (Gemini Omni 1.1 Flash):
[Tekst / Slika / Audio / Video] [Tekst / Slika / Audio / Video]
│ │
▼ ▼
[ Univerzalni Omni ] [ Omni 1.1 Flash Engine ]
│ │
▼ ▼
[Tekst / Slika / Audio / Video] [High-Res Video sa Nativnim Zvukom]
Gemini Omni 1.1 Flash [Preview / Experimental]
Aktuelna radna implementacija Omni koncepta.
- Ulazni modaliteti: Tekst, slike, audio i video.
- Trenutni izlaz: Video visoke rezolucije sa integrisanim audio zapisom.
- Potvrđene mogućnosti:
- Generisanje videa iz tekstualnih i slikovnih opisa (video generation).
- Konverzacijsko uređivanje postojećeg video materijala (conversational video editing).
- Produžavanje trajanja video kadrova (video extension).
- Interpolacija među-frejmova (keyframe interpolation).
- Skaliranje i povećanje rezolucije video zapisa (resolution upscaling).
Modeli za generisanje i obradu slika: Nano Banana / Gemini Image
Linija modela za kreiranje i semantičku izmenu slika pripada Gemini Image ekosistemu, poznatom pod nazivom Nano Banana. Ovi modeli dostupni su kroz Gemini API, Google AI Studio i Vertex AI.
Nano Banana Pro (Gemini Pro Image) [GA / Stable]
Vodeći model za generisanje slika visoke vernosti.
- Precizno renderovanje teksta: Pouzdano ispisuje etikete, tipografiju, znakove i duže natpise unutar slike.
- Kompleksni prostorni rasporedi: Prati detaljna uputstva o pozicioniranju objekata u sceni.
- Semantičko uređivanje: Podržava inpainting i outpainting uz očuvanje postojećeg stila i svetla.
Nano Banana 2 (Gemini Flash Image) [GA / Stable]
Model optimizovan za interaktivne aplikacije gde je brzina ključna. Podržava rad u rezolucijama 0.5K, 1K, 2K i 4K, kontrolu formata slike (aspect ratio), integrisano rezonovanje (Thinking), Search Grounding i korišćenje videa kao multimodalnog konteksta za generisanje slika.
Nano Banana 2 Lite [GA / Stable]
Cenovno najpovoljnija i najbrža varijanta. Reč je o cloud/API modelu optimizovanom za visokofrekventnu upotrebu i brzo interaktivno uređivanje. (Napomena: pojam „local edits“ kod ovog modela označava lokalizovane izmene na određenom delu slike, a ne lokalni on-device inferens na telefonu).
Nano Banana (Gemini 2.5 Flash Image) [Legacy]
Ranija generacija modela (gemini-2.5-flash-image) za koju Google preporučuje migraciju na seriju Nano Banana 2.
Video generacija: Veo 3.1
Porodica modela Veo namenjena je profesionalnom kreiranju pokretnih slika sa visokom vremenskom koherentnošću.
[Tekstualni opis ili Polazna slika]
│
▼
[ VEO 3.1 MODEL ]
│
┌──────────┴──────────┐
▼ ▼
[Video do 4K rezolucije] [Nativni Sinhronizovani Audio]
- Kontrola kamere i pokreta - Ambijent i zvučni efekti
- Temporalna koherentnost - Poboljšano audio-video poravnanje
- Dodavanje/uklanjanje - Dijalozi (područje aktivnog razvoja)
- Veo 3.1 [Preview - Gemini API]: Zvanični API endpoint:
veo-3.1-generate-preview(i brza varijantaveo-3.1-fast-generate-preview). Glavni model za Text-to-Video i Image-to-Video. Veo 3.1 podržava 1080p i 4K output za podržane generacije i trajanja (npr. do 8 sekundi). Poseduje ugrađeni sinhronizovani audio (ambijent, zvučni efekti i dijalozi sa poboljšanim vremenskim poravnanjem). Nudi režijsku kontrolu kamere, produžavanje scena (scene extension), kontrolu početnog i krajnjeg frejma (first/last frame control), outpainting i selektivno dodavanje ili uklanjanje objekata iz kadra. - Veo 3.1 Lite [Preview - Gemini API]: Zvanični API endpoint:
veo-3.1-lite-generate-preview. Brža verzija optimizovana za brzu proveru koncepata i pre-vizuelizaciju. - Veo 3 i Veo 2 [Legacy]: Prethodne generacije koje su postavile standarde vremenske konzistentnosti.
Muzika i generisanje zvuka: Lyria ekosistem
Razvijen u saradnji sa muzičkim stvaraocima, sistem Lyria bavi se generisanjem instrumentalnih deonica i pesama.
- Lyria 3.5 [GA / Stable]: Glavna aktuelna generacija (u stabilnoj fazi od 03.09.2026). Generiše celokupne muzičke numere u stereo tehnici na osnovu tekstualnih ili slikovnih promptova, uz podršku za tekst pesme (lyrics).
- Lyria 3 Pro [Preview / Legacy]: Prethodno izdanje za studijsko testiranje. (Napomena: višekanalni izvoz instrumenata u demonstracijama bio je deo aplikativnih tokova rada, a ne nativna funkcija samog modela).
- Lyria 3 Clip [Preview]: Zvanični API endpoint:
lyria-3-clip-preview. Model generiše kratke muzičke klipove i petlje (loops) u trajanju do približno 30 sekundi. - Lyria RealTime [Preview]: Interaktivni model koji u realnom vremenu dinamički menja muzički tok prateći spoljne događaje (npr. nivo akcije u igrama).
- Lyria 2 [Legacy]: Starija verzija. Označavanje zvuka vrši se tehnologijom vodenog žiga SynthID, koja je širi Google bezbednosni standard.
Gemma: Porodica modela otvorenih težina (Open-Weight)
Za inženjere i kompanije koje žele samostalno hostovanje na sopstvenim serverima bez slanja podataka spoljnim servisima, Google razvija porodicu otvorenih težina Gemma.
[ GEMMA 4 PORODICA ]
│
┌─────────────────────┼─────────────────────┐
▼ ▼ ▼
[Edge & Mobile] [Server Dense] [MoE Skaliranje]
Gemma 4 E2B (Edge) Gemma 4 12B Gemma 4 26B A4B (MoE)
Gemma 4 E4B (Edge) Gemma 4 31B
Gemma 4 serija [GA / Open-Weight]
- Gemma 4 E2B i E4B: Kontekstni prozor: 128K tokena. Modaliteti: Text, Image, Audio → Text. Optimizovani modeli za energetski efikasan rad na mobilnim uređajima i na ivici mreže (edge devices).
- Gemma 4 12B: Kontekstni prozor: 256K tokena. Modaliteti: Text, Image, Audio → Text. Model opšte namene za lokalno hostovane sisteme, multimodalnu analizu i programiranje.
- Gemma 4 26B A4B (MoE): Kontekstni prozor: 256K tokena. Modaliteti: Text, Image → Text. Mixture-of-Experts arhitektura gde se po svakom tokenu aktivira 4 milijarde parametara od ukupno 26 milijardi, što smanjuje utrošak računarskih resursa (compute) tokom inferensa.
- Gemma 4 31B: Kontekstni prozor: 256K tokena. Modaliteti: Text, Image → Text. Najveći gusti (dense) model otvorenih težina u ovoj liniji, namenjen za složeno rezonovanje i programiranje.
Šira porodica specijalizovanih Gemma modela
- FunctionGemma [GA]: Model prilagođen za prepoznavanje formata funkcija i pozivanje eksternih alata.
- EmbeddingGemma [GA]: Kompaktan model za lokalno kreiranje semantičkih vektora.
- DiffusionGemma [Experimental / Research]: Eksperimentalni model koji istražuje difuzione mehanizme za generisanje teksta umesto autoregresivnih slojeva.
- MedGemma & MedGemma 1.5 4B [Research / Open-Weight]: Modeli optimizovani za razumevanje medicinskih tekstova i analizu radioloških snimaka. (Napomena: model nije namenjen za samostalno postavljanje dijagnoza u kliničkoj praksi bez stručne verifikacije lekara).
- TranslateGemma [GA]: Specijalizovan za prevođenje teksta na 55 svetskih jezika.
- T5Gemma [GA]: Encoder-decoder arhitektura pogodna za ekstrakciju podataka i pretragu.
- ShieldGemma & ShieldGemma 2 [GA]: Bezbednosni klasifikatori za filtriranje tekstualnog i multimodalnog sadržaja.
- CodeGemma [GA]: Specijalizovan za analizu i generisanje koda.
- PaliGemma & PaliGemma 2 [GA]: Vision-Language modeli (VLM) za detekciju objekata i vizuelno odgovaranje na pitanja.
- RecurrentGemma [Research]: Hibridna arhitektura bazirana na Griffin mehanizmu sa fiksnom potrošnjom memorije pri radu sa dugim sekvencama.
- DolphinGemma [Research]: Naučni model kreiran u saradnji sa biolozima za akustičku analizu i istraživanje komunikacije delfina.
- Gemma 3 270M [GA]: Izuzetno mali model za ultra-lake zadatke klasifikacije.
- DataGemma [Research]: Povezuje modele sa javnim statističkim podacima putem Data Commons platforme.
- TxGemma [Research / Open-Weight]: Otvoreni modeli za rani razvoj lekova (detaljnije u sekciji o biologiji).
Robotika: Gemini Robotics (Embodied AI)
Primena vizuelno-jezičkih modela na kontrolu fizičkih robota odvija se kroz Vision-Language-Action (VLA) arhitekturu.
[Kamera i Senzori] ──→ [Gemini Robotics-ER 2] ──→ [Višestepeni Plan]
│
▼
[Gemini Robotics On-Device 2]
│
▼
[Motori i Manipulatori]
- Gemini Robotics 2 [Research / Limited Access]: Nativni VLA model za direktnu kontrolu tela i manipulatora robota u fizičkom svetu.
- Gemini Robotics-ER 2 [Research]: Embodied-Reasoning VLM sa 128K kontekstnim prozorom i 64K izlazom. Analizira tekst, slike, video i audio kako bi izveo prostorno, vremensko i fizičko rezonovanje i dugoročno planiranje zadataka.
- Gemini Robotics On-Device 2 [Research]: Model za lokalno izvršavanje na robotu bez oslanjanja na internet vezu. U istraživanjima je pokazao sposobnost prilagođavanja novim robotskim konfiguracijama uz manje od 200 demonstracija i nekoliko sati trening podataka.
World Modeli i simulacije: Genie 3 i SIMA 2
Istraživanja usmerena na razumevanje prostornih i fizičkih zakonitosti kroz simulacije:
Genie 3 [Research]
Generalni model sveta (World Model) koji iz tekstualnog opisa ili jedne slike generiše interaktivno 3D okruženje u realnom vremenu (oko 20–24 frejma u sekundi u 720p rezoluciji). Omogućava real-time navigaciju i dinamičke događaje u generisanom prostoru, uz vremensku konzistentnost koja traje nekoliko minuta. Reč je o neuronskom modelu sveta, a ne o klasičnom game engine-u.
SIMA 2 (Scalable Instructable Multiworld Agent) [Research]
Opšti AI agent koji koristi Gemini kao jezgro za rezonovanje. Posmatra svet isključivo preko piksela na ekranu i upravlja standardnim komandama (poput tastature i miša) bez pristupa internom programskom kodu igre. Sposoban je da prati multimodalne instrukcije u potpuno nepoznatim virtuelnim okruženjima i demonstriran je u integraciji sa Genie 3 simulacijama.
Multimodalni vektorski prostor: Gemini Embedding 2
Za sisteme semantičke pretrage i RAG (Retrieval-Augmented Generation) arhitekture:
- Gemini Embedding 2 [GA / Stable]: Zvanični API identifikator:
gemini-embedding-2.- Ulaz: Tekst, slike, video, audio i PDF dokumenti.
- Limit ulaza: 8,192 tokena.
- Izlazne dimenzije vektora: Fleksibilno od 128 do 3,072 dimenzije.
- Namena: Semantička pretraga, multimodalno pretraživanje, klasterizacija i unakrsno poređenje različitih medija u jedinstvenom vektorskom prostoru.
- Gemini Embedding 001 [GA / Stable]: Standardni tekstualni model za tekstualne baze znanja.
- EmbeddingGemma [GA / Open-Weight]: Otvoreni model za generisanje vektora na lokalnoj infrastrukturi.
Computer Use i Agentski sistemi
Prelazak sa pasivnog odgovaranja na aktivno izvršavanje zadataka u softverskom okruženju:
[Zadatak korisnika] ──→ [Gemini 3.8 Flash + Computer Use Tool]
│
┌────────────────────────┼────────────────────────┐
▼ ▼ ▼
[Screenshot ekrana] [Rezonovanje] [Akcija mišem/tastaturom]
- Prepoznavanje elemenata - Planiranje sledećeg - Klik, unos teksta,
- Čitanje tabela/formi koraka pomeranje kursora
Gemini Computer Use capability [Preview]
Funkcionalnost (alat) koja podržanim modelima (preporučeno Gemini 3.8 Flash) omogućava upravljanje grafičkim interfejsom u pretraživaču, mobilnom i desktop okruženju. Radi u petlji: snimak ekrana → planiranje → akcija → verifikacija novog stanja. Poseduje ugrađene bezbednosne mehanizme protiv prompt-injection napada i traži korisničku potvrdu za osetljive radnje. (Nasleđeni prethodni endpoint: gemini-2.5-computer-use-preview-10-2025).
Gemini Deep Research i Deep Research Max [Preview / Agent]
Autonomni istraživački agenti (API endpointi: deep-research-preview-04-2026 i deep-research-max-preview-04-2026). Poseduju 1M kontekst i 65K izlaz. Pretražuju internet, lokalne fajlove (File Search), koriste URL Context, MCP alate i izvršavanje koda kako bi unakrsno analizirali izvore i generisali strukturirane istraživačke izveštaje sa citiranim referencama i grafikonima.
CodeMender [Research / Limited Access - Security Agent]
AI agent za informacionu bezbednost koji kombinuje statičku analizu, dinamičko testiranje, fuzzing, diferencijalno testiranje i SMT rešavače radi automatskog pronalaženja ranjivosti i generisanja zakrpa koje pre integracije prolaze inženjerski pregled.
AI Co-Scientist [Research - Multi-Agent System]
Sistem zasnovan na Gemini modelima koji organizuje saradnju više specijalizovanih agenata. Agenti generišu hipoteze, kritikuju predloge drugih agenata i kroz format naučne debate vrše rangiranje i sintezu istraživačkih ideja.
Biologija, medicina i genomika: Alpha sistemi
DeepMind-ovi sistemi u oblasti prirodnih nauka bave se mapiranjem bioloških struktura i genetskog koda.
Biološki nivo: Sistem: Obim predikcija:
[3D Kompleksi] AlphaFold 3 Proteini, DNK, RNK, ligandi
[Tačkaste mutacije] AlphaMissense 71 milion missense varijanti
[Celokupan genom] AlphaGenome & Atlas ~9 milijardi nukleotidnih varijanti
[Terapeutski molekuli] TxGemma (2B, 9B, 27B) Mali molekuli, antitela, proteini
[Klinički tekst i slika] MedGemma Medicinski NLP i radiologija
AlphaFold 3 [GA / Scientific Access]
Model koji predviđa trodimenzionalne strukture i međusobne interakcije gotovo svih bioloških molekula: proteina, DNK, RNK i liganada (malih molekula ključnih za razvoj lekova).
AlphaGenome i AlphaGenome Atlas [Research]
Jedan od najvećih DeepMind naučnih proboja. AlphaGenome analizira regulatorne sekvence DNK i predviđa uticaj promena u genomu na funkcionisanje ćelije. AlphaGenome Atlas obuhvata predikcije za približno 9 milijardi pojedinačnih promena baza (single-nucleotide variants), što praktično pokriva svaku moguću jednostruku mutaciju u ljudskom genomu. Google DeepMind je objavio istraživačku implementaciju i pre-trenirane AlphaGenome težine (pretrained weights), koje su istraživačima dostupne preko platformi Kaggle i Hugging Face uz prihvatanje posebnih nekomercijalnih uslova licenciranja.
AlphaMissense [Research]
Klasifikovao je približno 71 milion mogućih humanih missense mutacija, od kojih je oko 89% svrstano u kategorije verovatno benignih ili verovatno patogenih, pružajući bazu za istraživanje retkih bolesti.
TxGemma [Research / Open-Weight]
Porodica otvorenih modela (veličina 2B, 9B i 27B) obučena na oko 7 miliona primera za terapeutski razvoj i evaluirana na preko 60 zadataka koji obuhvataju male molekule, proteine, nukleinske kiseline i ćelijske linije.
Vremenska prognoza, klima i Zemlja
AI modeli za modelovanje vremenskih prilika generišu prognoze znatno brže od klasičnih numeričkih metoda i postižu konkurentne ili bolje rezultate na specifičnim meteorološkim benchmarkovima.
- WeatherNext 3 [Operational / Production]: Koristi direktne satelitske podatke za globalnu prognozu vremena sa ažuriranjem na svakih sat vremena. WeatherNext 3 pruža station-targeted predikcije za temperaturu i tačku rose (dewpoint) na rezoluciji od približno 0.05° (~5 km), dok su standardne gridded surface promenljive poput temperature i vetra dostupne na približno 0.1° (~10 km), u zavisnosti od konkretnog meteorološkog proizvoda i izlaza.
- GenCast [Research]: Probabilistički difuzioni model koji kreira ansamble prognoza do 15 dana unapred, optimizovan za rano uočavanje ekstremnih vremenskih nepogoda.
- GraphCast [Research]: Grafovska neuronska mreža koja pravi globalnu desetodnevnu prognozu za manje od jednog minuta na jednom TPU procesoru.
- NeuralGCM [Research]: Hibridni model koji kombinuje numeričku dinamiku fluida sa mašinskim učenjem za dugoročne klimatske projekcije.
- AlphaEarth Foundations [Research]: Geoprostorni temeljni model za posmatranje Zemlje. Mapira gigabajte satelitskih snimaka u zajednički 64-dimenzionalni embedding prostor (preko 1.4 biliona prostornih tačaka godišnje) za praćenje promena u vegetaciji, poljoprivredi i vodotokovima.
Matematika, algoritmi i fundamentalna nauka
- AlphaEvolve [Research]: Evolucioni agentski sistem pogonjen Gemini modelima za otkrivanje novih algoritama. U produkcionom okruženju Google-ovih data centara pronašao je novu heuristiku za Borg raspoređivanje poslova koja je oslobodila približno 0.7% ukupnih Google računarskih resursa (compute).
- AlphaGeometry 2 i AlphaProof [Research]: Na Međunarodnoj matematičkoj olimpijadi (IMO 2024) ovi sistemi su postigli nivo ekvivalentan srebrnoj medalji (28/42 poena). AlphaProof formalizuje matematičke iskaze u jeziku Lean i samostalno sklapa formalno dokazane korake. Kasnije je na IMO 2025 noviji Gemini Deep Think dosegao nivo zlatne medalje (35/42).
- FunSearch [Research]: Sistem koji uparuje jezički model sa automatskim evaluatorom radi pronalaženja novih matematičkih rešenja, uspešno primenjen na problem cap set-a i heuristike za pakovanje (online bin packing).
Istorija i arheologija: Aeneas
- Aeneas [Research]: AI sistem kreiran za proučavanje antičkog pisanog nasleđa, obučen na bazi od preko 176,000 latinskih natpisa.
- Tačnost restauracije (Top-20): oko 73% za oštećenja do 10 karaktera, odnosno oko 58% kada dužina nedostajućeg teksta nije unapred poznata.
- Geografsko poreklo: oko 72% tačnosti u lociranju kroz 62 rimske provincije.
- Datiranje: procena unutar raspona od oko 13 godina u odnosu na istorijski konsenzus.
- Glavna inovacija: kontekstualizacija i pretraga paralela - povezuje oštećeni natpis sa srodnim istorijskim tekstovima.
Istorijski prekretnički sistemi u igrama (RL)
DeepMind-ovi rani proboji u učenju potkrepljivanjem (Reinforcement Learning):
- AlphaGo, AlphaGo Zero i AlphaZero [Historical / Research]: Savladali Go, šah i šogi učenjem kroz samostalno igranje.
- MuZero [Historical / Research]: Učenje strategije i pravila bez prethodnog znanja; u praksi primenjen na YouTube live infrastrukturi uz uštedu od približno 4% bitrate-a pri VP9 video kompresiji.
- DreamerV3 i Dreamer 4 [Historical / Research]: Učenje preko internog modela sveta; DreamerV3 je prvi agent koji je u igri Minecraft uspeo da pronađe dijamant od nule bez ljudskih demonstracija.
Velika uporedna matrica modela i sistema
Sledeća tabela objedinjuje ključne tehničke karakteristike za sve važne Google i Google DeepMind sisteme u 2026. godini:
| Naziv sistema | Porodica | Tip sistema | Status | Ulazni modaliteti | Izlazni modaliteti | Context Window | Max Output | Model ID / Pristup | Open-Weight? | Primarna namena |
|---|---|---|---|---|---|---|---|---|---|---|
| Gemini 3.8 Flash | Gemini | Foundation model | [GA / Stable] | Tekst, slika, video, audio, PDF | Tekst | 1,048,576 | 65,536 | gemini-3.8-flash | Ne | Agenti, coding, enterprise tokovi |
| Gemini 3.8 Flash Cyber | Gemini | Specialized cybersecurity model | [Limited Access] | Kod / security tasks; kompletni javni input modaliteti nisu specificirani | Tekst, zakrpe | Nije javno objavljeno | Nije javno objavljeno | Fairwind Program | Ne | Otkrivanje ranjivosti i popravke |
| Gemini 3.8 Live | Gemini Live | Conversational VLM | [GA / Stable] | Tekst, slika, audio, video | Tekst, Audio | 131,072 | 65,536 | gemini-3.8-live | Ne | Dvosmerni govor u realnom vremenu |
| Gemini 3.1 Pro | Gemini | Foundation model | [Preview] | Multimodalni (sve) | Tekst | 1,048,576 | 65,536 | gemini-3.1-pro-preview | Ne | Analiza velikih repozitorijuma |
| Gemini 3.1 Deep Think | Gemini | Reasoning model | [Preview] | Multimodalni | Tekst | Nije javno specificirano za Deep Think kao zaseban model | Nije javno specificirano | Nema zaseban javni Gemini API endpoint / Deep Think mode | Ne | Formalna matematika i nauka |
| Gemini 3.5 Pro | Gemini | Foundation model | [In Development] | Nije objavljeno | Nije objavljeno | Nije objavljeno | Nije objavljeno | Coming soon | Ne | Sledeći Gemini Pro model; detaljne javne specifikacije još nisu objavljene. |
| Gemini 4 | Gemini | Frontier model | [In Development] | Nije objavljeno | Nije objavljeno | Nije objavljeno | Nije objavljeno | Nije objavljeno / pre-training | Nije objavljeno | Sledeća Gemini generacija; detalji arhitekture i mogućnosti nisu javno objavljeni. |
| Gemini Omni 1.1 Flash | Gemini Omni | Generative multimodal | [Preview] | Tekst, slika, audio, video | Video, Audio | Nije objavljeno | Video segmenti | gemini-omni-1.1-flash | Ne | Video generisanje i obrada |
| Nano Banana Pro | Gemini Image | Image generation | [GA / Stable] | Text, Image | Image, Text | 65,536 | 32,768 | gemini-3-pro-image | Ne | Precizna tipografija i kompozicije |
| Nano Banana 2 | Gemini Image | Image generation | [GA / Stable] | Text, Image, Video, PDF | Image, Text | 131,072 | 32,768 | gemini-3.1-flash-image | Ne | Brzo generisanje uz Thinking |
| Nano Banana 2 Lite | Gemini Image | Image generation | [GA / Stable] | Text, Image, Video, PDF | Image, Text | 65,536 | 4,096 | gemini-3.1-flash-lite-image | Ne | Ekonomična i brza generacija |
| Veo 3.1 | Veo | Video generation | [Preview - Gemini API] | Tekst, slike | Video (1080p/4k) + Audio | Video prompt / kadrovi | Video klipovi | veo-3.1-generate-preview | Ne | Text-to-video sa zvukom |
| Veo 3.1 Lite | Veo | Video generation | [Preview - Gemini API] | Tekst, slike | Video + Audio | Video prompt | Brzi klipovi | veo-3.1-lite-generate-preview | Ne | Brza provera video ideja |
| Lyria 3.5 | Lyria | Audio generation | [GA / Stable] | Tekst, slike | Stereo muzika | Muzički prompt | Puna pesma | lyria-3.5 (Gemini API / Vertex AI) | Ne | Komponovanje sa aranžmanom |
| Lyria 3 Clip | Lyria | Audio generation | [Preview] | Tekst, slike | Stereo loop/clip | Muzički prompt | Do ~30s klip | lyria-3-clip-preview | Ne | Kratki muzički loopovi |
| Gemma 4 (E2B, E4B) | Gemma | Open-weight model | [GA / Open-Weight] | Text, Image, Audio | Text | 128K | Zavisno od alata | Hugging Face / Kaggle | DA | Efikasno edge izvršavanje |
| Gemma 4 12B | Gemma | Open-weight model | [GA / Open-Weight] | Text, Image, Audio | Text | 256K | Zavisno od alata | Hugging Face / Ollama | DA | Samostalno lokalno pokretanje |
| Gemma 4 26B A4B | Gemma | MoE model | [GA / Open-Weight] | Text, Image | Text | 256K | Zavisno od alata | Hugging Face / Kaggle | DA | Efikasno MoE izvršavanje |
| Gemma 4 31B | Gemma | Open-weight model | [GA / Open-Weight] | Text, Image | Text | 256K | Zavisno od alata | Hugging Face / Ollama | DA | Gusti model visokih performansi |
| Gemini Robotics 2 | Robotics | VLA model | [Research / Limited] | Senzori, video, govor | Motorske akcije | Real-time stream | Kontrolne komande | Istraživački pristup | Ne | Kontrola robotskih manipulatora |
| Genie 3 | World Models | World simulation | [Research] | Tekst, slike | 3D svet (720p 24fps) | Interaktivna sesija | Real-time video | Istraživački pristup | Ne | Interaktivne 3D simulacije sveta |
| SIMA 2 | Agent | Game / 3D agent | [Research] | Ekranski pikseli, govor | Tastatura / miš akcije | Vremenski prozor | Akcioni koraci | Istraživački radovi | Ne | Univerzalni agent za 3D svetove |
| Gemini Embedding 2 | Embeddings | Embedding model | [GA / Stable] | Tekst, slika, video, audio, PDF | Vektori (128-3072) | 8,192 tokena | Vektorski niz | gemini-embedding-2 | Ne | Multimodalni RAG i pretraga |
| Deep Research | Agenti | Autonomous research | [Preview / Agent] | Tekst, dokumenti, URL | Istraživački izveštaj | 1,048,576 | 65,536 | deep-research-preview-04-2026 | Ne | Duboko istraživanje interneta |
| AlphaFold 3 | Nauka | Biomolecular model | [GA / Scientific] | Sekvence proteina, DNK, ligandi | 3D molekulske strukture | Sekvence biopolimera | PDB/mmCIF koordinate | AlphaFold Server | Ne (kod javan za nekomercijalno) | Predviđanje struktura molekula |
| AlphaGenome | Nauka | Genomic foundation model | [Research] | DNK regulatorne sekvence | Funkcionalne predikcije | Genomske regije | Efekat varijanti | AlphaGenome Atlas | DA - ograničene istraživačke težine / nekomercijalna licenca* | Predviđanje efekata mutacija |
| WeatherNext 3 | Vreme | Weather model | [Operational / Production] | Satelitski snimci | Globalna satna prognoza | Globalna mreža | 0.05° (~5km) / 0.1° (~10km) | Google Weather / Earth Engine | Ne | Satna operativna meteorološka prognoza |
| AlphaEvolve | Agenti | Evolutionary coding | [Research] | Programski kod, testovi | Optimizovani kod | Codebase kontekst | Novi algoritam | Interno u Google-u | Ne | Otkrivanje novih algoritama |
* Google DeepMind je objavio istraživačku implementaciju i pre-trenirane AlphaGenome težine preko platformi Kaggle i Hugging Face uz prihvatanje posebnih nekomercijalnih uslova licenciranja.
Zaključak
Google i Google DeepMind u 2026. godini ne razvijaju jedan monolitan model, već namensku hijerarhiju sistema optimizovanih za različite računarske zahteve:
- Flash porodica je Google-ova glavna linija optimizovana za kombinaciju brzine, cene i agentskih produkcionih opterećenja.
- Live i Omni linije transformišu interakciju sa korisnicima ka nativnom govoru i video obradi bez međukoraka.
- Gemma serija pruža zajednici programera otvorene težine za lokalnu privatnost i samostalnu kontrolu.
- Alpha sistemi primenjuju specijalizovane AI metode na biologiju, genomiku, matematiku, algoritme, geoprostorne podatke i fundamentalne naučne discipline.
Google je zvanično potvrdio razvoj modela Gemini 4, ali konačna arhitektura i način na koji će objedinjavati postojeće multimodalne, glasovne, agentske i robotičke mogućnosti još nisu javno precizirani.
Podelite vaše utiske, pitanja ili savete u vezi sa ovim člankom.