GLM-5.3-Flash od Z.ai je otvorený multimodálny model pre prácu s textom aj obrazom. Pred vydaním sa anonymne testoval pod označením Ox Alpha. V testoch programovania a samostatnej práce agentov sa približuje modelom ako Claude Opus 4.8, pritom podľa zveeejnených údajov ponúka približne desetinové náklady oproti predchádzajúcim verziám GLM.
V praxi vyniká hlavne pri tvorbe aplikácií s používateľským rozhraním. GLM-5.3-Flash dokáže skontrolovať, ako sa stránka skutočne vykreslila, vyhodnotiť spätnú väzbu z prehlisdača a podľa nej samostatně opraviť či vylepšiť kód. Nepracuje tak len so zdrojovým textom, ale priebežne kontroluje aj výsledok, ktorý uvidí používateľ.
GLM 5.3: Powerful AI Is Becoming Almost Free. Video k výkonu modelů GLM a klesajícím nákladům na AI. Zdroj: https://www.youtube.com/watch?v=w9RDunJACkc
Za zmienku stojí tiež GLM-5.3, ktorý vďaka ďalšiemu dotrénovaniu rovnakého základu ako GLM-5.2 lepšie programuje a samostatne pracuje s nástrojmi. Pri uvedení dosiahol najlepší výsledkok v teste hľadania zraniteľností CyberGym. Z.ai plánuje model zverejniť po bezpečnostních úpravách, přibližně dva týdny od oznámení.
Zdroje: GLM-5.3-Flash na Hugging Face, oznámenie GLM-5.3 na blogu Z.ai.
Qwen3.8-27B ukazuje, že pre použiteľné lokálne programovanie už nepotrebujete obrí model. S 27 miliardami parametrov ponúka veľmi dobrý pomer veľkosti a schopností. Podľa dodaného testu si poradí s menšími aplikáciami aj návrhom prehľadného a vzhľadovo podareného rozhrania.
Vedľa textu rozumie obrázkom a videu, vrátane hodinových záznamov. Dlhý kontext využijete pri práci s rozsiahlejšími podkladmi a predpovedanie viac tokenov naraz pomáha zrýchliť odpovede. Qwen3.8-27B tak stojí za vyskúšanie nie len ako programátor, ale aj ako univerzálny lokálny asistent.
Podľa praktického merania spustíte Qwen3.8-27B na jedinej NVIDIA RTX 5090 s plným kontextom a rýchlosťou okolo 200 tokenov za sekundu. Výsledok závisí od konkrétnej konfigurácie a nastavenia modelu.
Praktický test Qwen3.8-27B. Ukážky lokálneho programovania a ďalších schopností modelu. Zdroj: https://www.youtube.com/watch?v=J_aqblUWj4k
Zdroj: Qwen3.8-27B na Hugging Face.
Qwen3.8-Flash-Next je predovšetkým ukážkou architektúry pripravovaného Qwen4. Z celkových 125 miliárd parametrov pri práci aktivuje len 6 miliárd. Kombinuje úspornejšie spracovanie kontextu s reprezentáciami krátkych sekvencií tokenov, ktorých výpočty sú menej náročné a ktoré možno ľahšie presunúť mimo GPU.
Schopnosťami sa Qwen3.8-Flash-Next pohybuje zhruba na úrovni GLM-5.3-Flash. V niektorých úlohách môže mierne zaostávať, vzhľadom na svoju veľkosť však ponúka veľmi solídne výsledky. Ukazuje tak, akým smerom by sa mohla vydať úspornejšia séria Qwen4.
Qwen3.8-Flash-Next spustíte na jedinej NVIDIA RTX PRO 6000. Pre využitie plného kontextu počítajte s konfiguráciou 2× NVIDIA RTX PRO 6000.
Zdroj: Qwen3.8-Flash-Next na Hugging Face.
GPT-6 Astra podľa OpenAI dosahuje špičkové výsledky v ovládaní počítača, prehliadaní webu, programovaní, kybernetickej bezpečnosti aj vedeckých úlohách. Dodané výsledky a skúsenosti ho radia medzi najsilnejšie súčasné modely, vrátane porovnania s Claude Fable 5.1. Samotné výsledky testov však ešte nie sú dôkazom všeobecnej umelého inteligencie.
Prístup získal najskôr len obmedzený okruh organizácií a následne OpenAI postupne pridalo model aj do ostatných placených tarifov ChatGPT, svojho API aj služieb Azure a Amazon Bedrock.
Introducing GPT-6 Astra. Predstavenie modelu a jeho zamerania podľa OpenAI. Zdroj: https://www.youtube.com/watch?v=1QNsdr-Qx_I
Zdroj: oznámenie GPT-6 Astra na webe OpenAI.
Otestujte výkon NVIDIA RTX PRO 6000 Blackwell pre vLLM, firemné AI API aj viac používateľov súčasne.
Bez investície do vlastného hardwaru si overíte, aká konfigurácia vyhovuje vášmu modelu a záťaži.
Claude Fable 5.1 a Claude Mythos 5.1 predstavuje Anthropic ako svoje najpokročilejšie modely pre programovanie, odbornú prácu a výskum. Ide o rovnaký model s odlišným nastavením bezpečnostných obmedzení. Claude Mythos 5.1 má obmedzený prístup a je prispôsobený pre kybernetickú bezpečnosť, medicínu a biotechnológie.
Praktickým prínosom Claude Fable 5.1 sú lacnejšie opakované čítania z vyrovnávacej pamäte. Bežná prevádzka tak podľa Anthropicu vychádza zhruba o štvrtinu lacnejšie než pri Claude Fable 5. Súčasťou zmien sú tiež upravené podmienky uchovávania dát.
Introducing Claude Fable 5.1. Predstavenie novej verzie modelu od Anthropicu. Zdroj: https://www.youtube.com/watch?v=ROF2Nv_KjOM
Zdroj: oznámenie Claude Fable 5.1 a Mythos 5.1.
Gemini 3.8 Flash podľa Googlu prekonáva v teste dlhodobých programovacích úloh DeepSWE 1.1 väčšinu väčších špičkových modelov, pričom stojí výrazne menej. Zlepšenie prináša tiež pri práci s finančnými a právnymi úlohami. Podporuje text, obraz, video, zvuk aj PDF a ponúka vstupný kontext s veľkosťou 1 milión tokenov.
Slabinou podľa dodaných skúseností zostáva vysoká spotreba tokenov. Čiastočne ju vyvažuje rýchlosť cez 250 tokenov za sekundu, ale pri výbere sledujte hlavne cenu a čas za dokončenú úlohu, nie len cenu jedného tokenu.
Praktický test Gemini 3.8 Flash. Ukážky schopností novej verzie modelu od Googlu. Zdroj: https://www.youtube.com/watch?v=qibRvfnvDMM
Zdroj: Gemini Flash na webe Google DeepMind.
Muse Spark 1.3 sa zameriava na spoľahlivejšiu samostatnú prácu. Lepšie drží zadanie pri dlhých úlohách, skladá si potrebný kontext z neusporiadaných podkladov a priebežne opravuje nedostatky vo svojom pláne.
Zaujímavý je dôraz na spoluprácu. Keď zadanie nie je jasné, model sa aktívne dopytuje. Ak sa zasekne, požiada o pomoc a pred zásadnými krokmi si vyžiada potvrdenie. Muse Spark 1.3 je dostupný v Muse Code a cez Meta Model API, vrátane najvyššej úrovne uvažovania.
Meta Muse Spark 1.3. Video predstavuje model a porovnáva ho s konkurenciou série Claude Opus. Zdroj: https://www.youtube.com/watch?v=tLlEzZUyGdM
Zdroj: predstavenie Muse Spark 1.3 na blogu Meta.
DeepSeek V4 Flash Vision pridáva do série V4 porozumenie obrazu. Vychádza z architektúry Flash a podľa zverejnených výsledkov zlepšuje prácu agentov s vizuálnymi podkladmi, zatiaľ čo schopnosti pri čisto textových úlohách zostávajú takmer rovnaké. V teste programovania DeepSWE je o niečo lepší než Claude Opus 4.8.
Model je dostupný pod licenciou MIT, takže model môžete prevádzkovať aj upravovať na vlastnej infraštruktúre. Zatiaľ ide o experimentálnu verziu, ktorú je vhodné najskôr overiť na vlastných úlohách.
Zdroj: DeepSeek V4 Flash Vision na Hugging Face.