
Americký startup PrismML v úterý 14. července skutečně vydal Bonsai 27B, komprimovanou verzi otevřeného modelu Qwen3.6 od Alibaby, kterou zmenšil z 54 GB na méně než 6 GB. CEO firmy navíc poprvé přímo pro CNBC potvrdil, že Apple technologii „opravdu teď vyhodnocuje“. Jednání jsou podle něj velmi raná a jejich výsledek zůstává nejasný.
Úvod
Spekulace o tom, že Apple jedná se startupem, který umí nacpat velké jazykové modely do kapesního telefonu, kolovaly už od začátku července. Teď má téma dva nové, ověřitelné body. PrismML model, o kterém se mluvilo, skutečně vydal, a to zdarma pod otevřenou licencí. A firma poprvé oficiálně potvrdila, že s Applem o technologii jedná, místo aby se o tom jen spekulovalo z doslechu.
Co PrismML skutečně vydal: dvě varianty, licence, dostupnost
PrismML, spin-off týmu z Caltechu podporovaný investorem Khosla Ventures, vydal 14. července model Bonsai 27B ve dvou variantách. První, označovaná jako 1-bit, ukládá váhy modelu jen ve dvou možných hodnotách a zabírá přibližně 3,9 GB. Druhá, ternary (1,58bitová), pracuje se třemi hodnotami a váží kolem 5,9 GB. Obě vycházejí z otevřeného modelu Qwen3.6 27B od Alibaby a jsou k dispozici zdarma pod licencí Apache 2.0, včetně dokumentace, vah na Hugging Face a GitHubu i mobilní aplikace Locally AI pro iOS.
Podle oficiálního oznámení PrismML jde o multimodální model, který kromě textu zvládá i obrázky, a je určený na složitější úlohy: plánování, psaní a ladění kódu, práci s nástroji a takzvané agentní workflow, tedy úkoly, kde model sám postupně provádí více kroků. Model běží v takzvaném thinking módu, který si před odpovědí projde krok za krokem vlastní uvažování.
Bonsai 27B přitom není první pokus PrismML tímto směrem. Firma už dřív v roce vydala menší modely stejné rodiny, konkrétně 1-bit a ternary verze o 8, 4 a 1,7 miliardách parametrů. Nové vydání jde jen o krok dál: stejnou techniku aplikuje na výrazně větší, 27miliardový model.
Jak velký pokrok to je: z 54 GB na méně než 6 GB
Standardní verze modelu Qwen3.6 27B s plnou přesností by podle výrobce potřebovala kolem 54 GB paměti, což žádný telefon ani běžný notebook nezvládne. Komprimovaná 1-bit varianta to snižuje na přibližných 3,9 GB, tedy zhruba čtrnáctkrát méně, ternary varianta na 5,9 GB, což je asi devítinásobné zmenšení.
PrismML tvrdí, že ternary verze si drží přes 95 procent výkonu původního modelu v interních testech, 1-bit verze přes 90 procent. Server MarkTechPost k tomu doplňuje podrobnější čísla z metodiky firmy: na patnácti benchmarcích v thinking módu drží ternary varianta 94,6 procenta výkonu plné verze, 1-bit varianta 89,5 procenta. Firma zároveň uvádí, že komprimované modely spotřebují 10 až 15krát méně paměti, generují odpovědi 6 až 8krát rychleji a spotřebují 3 až 6krát méně energie než běžné verze na stejném hardwaru.
Je ale potřeba mít na paměti, že jde výhradně o čísla z interního testování samotné firmy. Žádný z dostupných zdrojů nezmiňuje nezávislé ověření třetí stranou, ať už akademickou skupinou nebo srovnávací recenzí mimo materiály PrismML.
Na jakých iPhonech to reálně běží
Tady je nutné rozlišit dvě různé věci, které se ve zprávách o vydání snadno pletou. PrismML svůj konkrétní výkonnostní test, tedy reálně naměřenou rychlost 11 tokenů za sekundu, demonstroval na iPhonu 17 Pro, tedy na nejnovějším a nejvýkonnějším modelu. Oficiální oznámení firmy mluví o cíli „vysoce výkonná mobilní zařízení, jako je iPhone 17 Pro“.
CNBC ale ve svém článku uvádí širší formulaci: že model díky nízké paměťové náročnosti (pod 4 GB) může teoreticky běžet už na iPhonu 15 nebo novějším, protože iPhone 15 Pro má 8 GB paměti a to by mělo na provoz komprimovaného modelu stačit. Server AppleInsider tuto úvahu potvrzuje a dodává, že jde o teoretickou proveditelnost na základě dostupné paměti, ne o reálně změřený test na starším telefonu.
Jinými slovy: reálně naměřený benchmark existuje jen pro iPhone 17 Pro. Tvrzení, že model poběží i na starších telefonech s dostatkem paměti, je rozumný technický odhad, ne demonstrovaný výsledek. Kdo očekává stejnou rychlost na iPhonu 15 Pro jako na 17 Pro, může být zklamaný: novější čip má výrazně vyšší výpočetní výkon.
Co řekl CEO Babak Hassibi o jednání s Applem
Nejsledovanější částí zprávy je vyjádření CEO PrismML Babaka Hassibiho pro CNBC. Řekl doslova, že Apple „opravdu teď vyhodnocuje“ technologii jeho firmy. Jednání označil za velmi raná, s nejasným výsledkem, ale dodal, že podle něj „věci postupují dobře“.
Je to první případ, kdy něco takového potvrzuje přímo zástupce PrismML, ne jen odvozená zpráva z druhé ruky. Jak jsme dříve informovali, na začátku července se o raných rozhovorech Applu se startupem mluvilo jen jako o spekulaci, kterou přinesl server The Information a převzaly další weby. Teď jde o citovaný výrok přímo od firmy.
Server 9to5Mac k tomu ale přidává opatrnou poznámku: vyjadřuje skepsi k tomu, že PrismML o jednáních s Applem vůbec veřejně mluví, protože podobné rozhovory mezi startupy a Applem obvykle zůstávají důvěrné. Nejde o zpochybnění toho, že k jednání dochází, spíš o upozornění, že vyjádření CEO stojí za to brát s určitou rezervou, protože firmě se hodí do karet, aby o zájmu Applu věděl co nejvíc lidí.
Charakter případné spolupráce, tedy zda by šlo o licenční dohodu, investici nebo něco úplně jiného, žádný ze zdrojů neupřesňuje. Apple se k dotazu CNBC nevyjádřil.
Nezávislé ověření zatím chybí: co říkají analytici
Analytička Carolina Milanesi ze společnosti Creative Strategies vidí v menších modelech příležitost pro Apple přesunout na telefon náročnější funkce, jako je výpočetní fotografie, generování videa nebo nástroje pracující s citlivými zdravotními daty přímo na zařízení. Horace Dediu z Asymco to vidí podobně: podle něj Apple testuje, jak velký a chytrý model se vejde na zařízení, a jeho výhodou je propojení vlastních čipů se softwarem.
Opatrnější tón mají Tarun Pathak z Counterpoint Research a Phil Solis z IDC. Oba upozorňují, že tvrzení PrismML je potřeba ověřit mimo kontrolované demonstrace: zajímá je hlavně výkon při delších promptech, spotřeba baterie při běžném vícenásobném používání telefonu a spolehlivost při nasazení do masového provozu, ne jen v laboratorních podmínkách.
Kdokoli si chce technologii vyzkoušet sám, může to udělat bez stahování, přímo v prohlížeči. Model běží díky technologii WebGPU v demu na Hugging Face, kde vývojář spojený s komunitou Transformers.js popisuje zmenšení modelu na přibližně 3,8 GB při zachování kolem 90 procent původního výkonu. Jde ale o desktopové ověření v prohlížeči, ne o test na mobilním zařízení.
Co to znamená pro české uživatele
Vydání Bonsai 27B samo o sobě nic nemění na tom, co dnes umí iPhone nebo Apple Intelligence. Jde o otevřený model, který si může vyzkoušet kdokoli s dostatečně výkonným zařízením, včetně vývojářů a nadšenců v Česku, ale zatím ne o produkt integrovaný do Applu.
Pokud by Apple technologii podobnou té od PrismML skutečně nasadil, šlo by hlavně o posun směrem k větší ochraně soukromí: víc AI úloh zpracovaných přímo v telefonu znamená míň dat odeslaných na vzdálené servery, což je v souladu s principy, na které klade důraz evropská regulace ochrany osobních údajů. V kontextu evropského zákona o digitálních trzích (DMA), který tlačí na otevřenost platforem, by šlo i o otázku, jak rychle by se podobné funkce k evropským uživatelům vůbec dostaly ve srovnání s americkým trhem. Nic z toho ale zatím není potvrzené, jde jen o možný důsledek, kdyby k dohodě mezi Applem a PrismML došlo.
Závěr
Za posledních pár dní se téma posunulo od nepotvrzené spekulace k dvěma ověřitelným faktům: model skutečně existuje a dá se stáhnout, a firma sama poprvé přiznala, že s Applem jedná. Zůstává ale otevřené to nejdůležitější: jestli, v jaké podobě a kdy by se podobná technologie mohla objevit v telefonech, které lidé skutečně používají. Benchmarky rychlosti a úspor zatím pochází jen od samotného PrismML a nezávislé ověření podle dostupných informací chybí.












