GLM-5.3-Flash od Z.ai je otevřený multimodální model pro práci s textem i obrazem. Před vydáním se anonymně testoval pod označením Ox Alpha. V testech programování a samostatné práce agentů se přibližuje modelům jako Claude Opus 4.8, přitom podle zveřejněných údajů nabízí přibližně desetinové náklady oproti předchozím verzím GLM.
V praxi vyniká hlavně při tvorbě aplikací s uživatelským rozhraním. GLM-5.3-Flash dokáže zkontrolovat, jak se stránka skutečně vykreslila, vyhodnotit zpětnou vazbu z prohlížeče a podle ní samostatně opravit či vylepšit kód. Nepracuje tak jen se zdrojovým textem, ale průběžně kontroluje i výsledek, který uvidí uživatel.
GLM 5.3: Powerful AI Is Becoming Almost Free. Video k výkonu modelů GLM a klesajícím nákladům na AI. Zdroj: https://www.youtube.com/watch?v=w9RDunJACkc
Za zmínku stojí také GLM-5.3, který díky dalšímu dotrénování stejného základu jako GLM-5.2 lépe programuje a samostatně pracuje s nástroji. Při uvedení dosáhl nejlepšího výsledku v testu hledání zranitelností CyberGym. Z.ai plánuje zveřejnit jeho váhy po bezpečnostních úpravách, přibližně dva týdny od oznámení.
Zdroje: GLM-5.3-Flash na Hugging Face, oznámení GLM-5.3 na blogu Z.ai.
Qwen3.8-27B ukazuje, že pro použitelné lokální programování už nepotřebujete obří model. S 27 miliardami parametrů nabízí velmi dobrý poměr velikosti a schopností. Podle dodaného testu si poradí s menšími aplikacemi i návrhem přehledného a vzhledově povedeného rozhraní.
Vedle textu rozumí obrázkům a videu, včetně hodinových záznamů. Dlouhý kontext využijete při práci s rozsáhlejšími podklady a předpovídání více tokenů najednou pomáhá zrychlit odpovědi. Qwen3.8-27B tak stojí za vyzkoušení nejen jako programátor, ale i jako univerzální lokální asistent.
Podle praktického měření spustíte Qwen3.8-27B na jediné NVIDIA RTX 5090 s plným kontextem a rychlostí kolem 200 tokenů za sekundu. Výsledek závisí na konkrétní konfiguraci a nastavení modelu.
Praktický test Qwen3.8-27B. Ukázky lokálního programování a dalších schopností modelu. Zdroj: https://www.youtube.com/watch?v=J_aqblUWj4k
Zdroj: Qwen3.8-27B na Hugging Face.
Qwen3.8-Flash-Next je především ukázkou architektury připravovaného Qwen4. Z celkových 125 miliard parametrů při práci aktivuje jen 6 miliard. Kombinuje úspornější zpracování kontextu s reprezentacemi krátkých sekvencí tokenů, jejichž výpočty jsou méně náročné a které lze snáze přesunout mimo GPU.
Schopnostmi se Qwen3.8-Flash-Next pohybuje zhruba na úrovni GLM-5.3-Flash. V některých úlohách může mírně zaostávat, vzhledem ke své velikosti ale nabízí velmi solidní výsledky. Ukazuje tak, jakým směrem by se mohla vydat úspornější řada Qwen4.
Qwen3.8-Flash-Next spustíte na jediné NVIDIA RTX PRO 6000. Pro využití plného kontextu počítejte s konfigurací 2× NVIDIA RTX PRO 6000.
Zdroj: Qwen3.8-Flash-Next na Hugging Face.
GPT-6 Astra podle OpenAI dosahuje špičkových výsledků v ovládání počítače, procházení webu, programování, kybernetické bezpečnosti i vědeckých úlohách. Dodané výsledky a zkušenosti jej řadí mezi nejsilnější současné modely, včetně srovnání s Claude Fable 5.1. Samotné výsledky testů ale ještě nejsou důkazem obecné umělé inteligence.
Přístup získal nejdříve jen omezený okruh organizací a následně OpenAI postupně přidalo model i do ostatních placených tarifů ChatGPT, svého API i služeb Azure a Amazon Bedrock.
Introducing GPT-6 Astra. Představení modelu a jeho zaměření podle OpenAI. Zdroj: https://www.youtube.com/watch?v=1QNsdr-Qx_I
Zdroj: oznámení GPT-6 Astra na webu OpenAI.
Otestujte výkon NVIDIA RTX PRO 6000 Blackwell pro vLLM, firemní AI API i více uživatelů současně.
Bez investice do vlastního hardwaru si ověříte, jaká konfigurace vyhovuje vašemu modelu a zátěži.
Claude Fable 5.1 a Claude Mythos 5.1 představuje Anthropic jako své nejpokročilejší modely pro programování, odbornou práci a výzkum. Jde o stejný model s odlišným nastavením bezpečnostních omezení. Claude Mythos 5.1 má omezený přístup a je přizpůsobený pro kybernetickou bezpečnost, medicínu a biotechnologie.
Praktickým přínosem Claude Fable 5.1 jsou levnější opakovaná čtení z mezipaměti. Běžný provoz tak podle Anthropicu vychází zhruba o čtvrtinu levněji než u Claude Fable 5. Součástí změn jsou také upravené podmínky uchovávání dat.
Introducing Claude Fable 5.1. Představení nové verze modelu od Anthropicu. Zdroj: https://www.youtube.com/watch?v=ROF2Nv_KjOM
Zdroj: oznámení Claude Fable 5.1 a Mythos 5.1.
Gemini 3.8 Flash podle Googlu překonává v testu dlouhodobých programovacích úloh DeepSWE 1.1 většinu větších špičkových modelů, přitom stojí výrazně méně. Zlepšení přináší také při práci s finančními a právními úkoly. Podporuje text, obraz, video, zvuk i PDF a nabízí vstupní kontext o velikosti 1 milion tokenů.
Slabinou podle dodaných zkušeností zůstává vysoká spotřeba tokenů. Částečně ji vyvažuje rychlost přes 250 tokenů za sekundu, ale při výběru sledujte hlavně cenu a čas za dokončený úkol, ne jen cenu jednoho tokenu.
Praktický test Gemini 3.8 Flash. Ukázky schopností nové verze modelu od Googlu. Zdroj: https://www.youtube.com/watch?v=qibRvfnvDMM
Zdroj: Gemini Flash na webu Google DeepMind.
Muse Spark 1.3 se zaměřuje na spolehlivější samostatnou práci. Lépe drží zadání při dlouhých úkolech, skládá si potřebný kontext z neuspořádaných podkladů a průběžně opravuje nedostatky ve svém plánu.
Zajímavý je důraz na spolupráci. Když zadání není jasné, model se aktivně doptává. Pokud se zasekne, požádá o pomoc a před zásadními kroky si vyžádá potvrzení. Muse Spark 1.3 je dostupný v Muse Code a přes Meta Model API, včetně nejvyšší úrovně uvažování.
Meta Muse Spark 1.3. Video představuje model a porovnává jej s konkurencí řady Claude Opus. Zdroj: https://www.youtube.com/watch?v=tLlEzZUyGdM
Zdroj: představení Muse Spark 1.3 na blogu Meta.
DeepSeek V4 Flash Vision přidává do řady V4 porozumění obrazu. Vychází z architektury Flash a podle zveřejněných výsledků zlepšuje práci agentů s vizuálními podklady, zatímco schopnosti při čistě textových úkolech zůstávají téměř stejné. V testu programování DeepSWE je o něco lepší než Claude Opus 4.8.
Váhy jsou dostupné pod licencí MIT, takže model můžete provozovat i upravovat na vlastní infrastruktuře. Zatím jde o experimentální verzi, kterou je vhodné nejdřív ověřit na vlastních úlohách.
Zdroj: DeepSeek V4 Flash Vision na Hugging Face.