On-device AI s Apple Foundation Models: co jsem se naučil v praxi

On-device AI s Apple Foundation Models: co jsem se naučil v praxi
AUTOR
Antonín Šimek

S Apple Foundation Models jsem se potkal na workshopu v Amsterdamu. Dva dny, hands-on zkušenost, 30 vybraných lidí. Poznatky jsem pak hned zapracoval do Guest Connectu, naší eventové aplikace, kde AI běží kompletně na zařízení bez potřeby serveru.

Většinou se o on-device AI píše v souvislosti s omezeními. Malé modely, malá kontextová okna, omezená jazyková podpora. Osobně jsem se toho dozvěděl a naučil mnohem víc, až když jsem se do toho ponořil a začal stavět. A vidím, jak se většina těch omezení posouvá.

Na letošním WWDC Apple oznámil zásadní změny ve frameworku. Modely rostou z přibližně 3 miliard parametrů na zhruba 20 miliard, kontextové okno se rozšiřuje a zavádí se podpora pro vstup obrázků. 

Nic z toho ještě není oficiálně venku, nový iOS je stále v betě, ale vím, že co mě na workshopu nejvíc limitovalo, se s další verzí výrazně posune.

Své zkušenosti jsem prezentoval na App & Tell, meetupu pro mobilní vývojáře, který jsme  v červnu 2026 pořádali v Praze. Foundation Models jsem mezitím reálně nasadil do Guest Connectu, naší eventové aplikace, která je dnes už součástí každého eventu v Etnetera Group.

Proč stojí on-device AI za pozornost

Model běží lokálně. Nic nejde přes server, data zůstávají na zařízení, neřešíte API klíče ani rate limity. A za žádný request neplatíte. Pro většinu případů je právě tohle ten největší rozdíl.

Pro uživatele to znamená, že funkce je rychlá. Pro byznys se tím otevírají nové možnosti. Jakákoli aplikace pracující s citlivými daty, ať finančními, zdravotními nebo osobními, může přidat inteligenci bez toho, aby data kamkoli odesílala. Soukromí se tak stává výchozí vlastností.

Omezení existují a dostanu se k nim dál v textu. Model běží na zařízení uživatele, ať je to iPhone, Mac nebo Apple Watch. Výkonem se s cloudovým modelem měřit nemůže. Výhodou je rychlost, kterou uživatel přímo pocítí.

Co jsem ověřil na naší eventové aplikaci

V Guest Connectu účastníci vidí program, zorientují se v eventovém prostoru, dostanou notifikaci, když začíná přednáška, nebo najdou potřebné kontakty.

Přidal jsem zatím dvě funkce postavené kompletně na on-device Foundation Models:

  • Shrnutí eventu: Nikdo na naší straně ho nemusí psát. Model vezme data o eventu, timeline, speakery, témata a vytvoří shrnutí na míru.
  • Q&A okno: Místo např. scrollování programem se rovnou v aplikaci zeptáte a ta odpovídá na základě znalosti dat o eventu.

Obě funkce fungují offline a reagují prakticky okamžitě. Vše běží na hardwaru uživatele.

V praxi to znamená, že jakákoli aplikace s lokálním obsahem může využít stejný přístup. Sumarizace, klasifikace, smart replies, vyhledávání, extrakce textu, analýza sentimentu, úprava tónu, anonymizace dat. On-device modely zvládnou více, než většina vývojářů čeká.

Kde vidím potenciál on-device AI

Přístup aplikovaný na Guest Connectu má mnohem širší využití. On-device AI se hodí všude, kde je úloha ohraničená a uživatel ocení rychlost, soukromí nebo nižší náklady. 

Sumarizace: Poznámky z meetingů, support tickety, popisy produktů, reporty. Cokoli, kde máte blok textu a potřebujete kratší verzi. 

Klasifikace a personalizace: Model může zkontrolovat produkt vůči tomu, co o uživateli ví, a okamžitě označit relevanci. Praktický příklad: dietní omezení v nákupní aplikaci. Aplikace ví, že uživatel nemůže lepek, produktová data jsou lokální, kontrola proběhne bez prodlevy.

Smart replies a auto-complete: Kontextové návrhy na základě toho, co uživatel právě píše. 

On-device search: Model rozumí tomu, co uživatel hledá, ne jen klíčovým slovům. Užitečné v jakékoli aplikaci s katalogem, knowledge base nebo content library.

Přístupnost: Generování popisků, úprava obsahu, lepší použitelnost rozhraní. 

Kde to nestačí

Model je záměrně omezený. Několik miliard aktivních parametrů oproti stovkám miliard u nejvýkonnějších cloudových modelů. Na složité uvažování, dlouhé dokumenty nebo otevřené konverzace stále potřebujete cloud.

Kontextové okno je sice větší než dřív, ale pořád poměrně malé. Pro nahrání hodinového přepisu to nebude stačit. Postavil jsem si pro toto workaround, který dlouhý vstup rozdělí přes víc sessions a souhrny pak spojí dohromady. Od určitého bodu ale kvalita klesá.

Je důležité znát reálný limit a nepředstírat, že neexistuje. Když úloha přeroste lokální model, přepnete na cloudové API stejným kódem.

Čeština zatím není podporována. Bez serveru se u nás v tomto případě neobejdete.

A je tu několik dalších věcí, které musíte vyřešit, než cokoli shipnete. Model běží pouze na zařízeních, která podporují Apple Intelligence. Pro iOS to znamená iPhone 15 a novější. Navíc si uživatel musí samotný model nejdřív stáhnout. Každý z těchto stavů musíte v aplikaci pokrýt.

Kam Foundation Models směřují

Apple staví Foundation Models jako platformu. Přes stejné Swift API se dá pracovat s lokálním modelem i s cloudem, ať už je to Gemini nebo OpenAI. Napíšete on-device verzi a když nestačí, přepnete na cloud stejným kódem. Prompty a instrukce jde nově testovat i přes CLI, bez spouštění celé aplikace.

Pokud zvažujete investici do on-device AI, sledujte aktuální stav, ale i směr, kterým se ubírá. Co funguje dnes, bude fungovat za půl roku mnohem lépe nebo jinak. Omezení, která dnes blokují určité use casy, je nemusí blokovat dlouho.

Přečtěte si také

Vytvořme společně něco skvělého

Jste připraveni vylepšit váš digitální produkt?
Rádi vám s tím pomůžeme.
Online konzultace