← Zpět na hlavní stránku

Lokální AI modely: Jak rozjet DeepSeek a Qwen doma | Podcast

·1:29:08
Shrnutí epizody

Tato epizoda rozebírá technické a praktické aspekty provozování lokálních jazykových modelů jako DeepSeek, Kimi nebo Qwen na vlastním hardwaru. Jiří Bernovský vysvětluje klíčovou roli kvantizace a nároky na VRAM u grafických karet při stavbě domácí AI stanice. Tento podcast o umělé inteligenci přináší konkrétní pohled na energetickou náročnost a budoucnost otevřených modelů v evropském kontextu. Diskuse nabízí hluboký vhled do toho, jaké technologické novinky česky ovlivňují současnou AI scénu.

Hlavní body

Přepis epizody

Tak než tak mě řekni tady tu své demaci, on se začne snaží, on začne dělat taký brute force ataky, prostě na hesla, jo, podívá se, poskenuje to. To mě to dostalo, protože za kus káblíku půlmetrovýho je to zaplatit 6 tisíc. Ale je tam kavárna, která se jmenuje AGI Coffee, kde mají lokální jej postavení, který serviruje DeepSeek, když tam přijdeš prostě, tak tam máš jako endpoint a jako dokud konzumuješ její věci, tak se můžeš napojit prostě svoje aplikace jako na jich endpoint. Ty modly jsou všechny jako hodně, hodně doleva. Tak ahoj všichni, máme tu 13. díl našeho podcastu, kde skončí zítřek, dneska s naším dalším hostem, kterým je Jirka Bernovský, ahoj. Ahoj. A nějakému projektovému řízení. Takže určitě je to člověk na slovo vzatý, tady v té oblasti. A my se dneska budeme bavit převážně o lokálních modelech, které ty na svých počítačích různě testuješ a rozjíždíš si takové svoje projekty, právě co se týká tady těch středních a malých jazykových modelů. Takže jsem tady takový radostný výkřiky, jako všechno vyhulené na max. To, co jsem na něm profrčel, tak bych se nedoplatil na tokeny. Takže i takhle nadšený reakce jsou na čínský deep seek. Jak to valí teda? No, valí to překvapivě dobře. Já jsem teď vlastně zainvestoval do Nvidia Spark OM verze od Asusu a Asus Ascent GB10, prostě stroj, o kterém jsem dlouho přemýšlel, o kterém jsem tak trošku pohrdal, protože mám relativně pomalu paměť a teď mi na něm běží a i klientovi, firmnímu, respektive už dvěma, teď teda běží deep seek, A4, Flash 07, 31 a ty hlasy jsou zatím super. No a když zapomenu teďka na ten deep seek, ke kterému se ještě vrátíme a dostaneme ve spoji, prostě s tím Sparkem, tak jsem chtěl začít vlastně tím, že velký halo zaznamenal Kymica 3, který je teďka největším otevřeným modelem, který je k dispozici a bylo to až takový halo, že vlastně Číňani trošku zvažovali, jestli takové modely do budoucna budou nebo nebudou pouštět. Jak to o tom myslíš, jako jak moc je už ten Kymie dobrý? Kymie je velice dobrý, Kymie šlapé na paty modelům, který byly před půl rokem mezi těmi top modely od uzavřených laboratoří, uzavřené váhy a teď vlastně je to tuším 2,8 trilionů parametrový model, který byl vydaný, který je open weight, není úplně open source, ale prostě je open weight a je velice výkonný a dá se používat na velkou spoustu věcí. A spousta lidí na něm šetří spoustu peněz, protože stojí zlomek toho, co stojí ty vrcholové modely od OpenAI nebo od Anthropic. Jo. No a co říkáš tomu, že vlastně oni to vydali a za 48 hodin byla vyčerpaná jejich hardverová kapacita a všichni, kdo si dneska to chtějí vyzkoušet, tak včetně mě, tak jediný, co můžou udělat, tak je, že se zapíšou do nějakého waiting listu na jejich stránkách, což ani to, nějakou chvíli nešlo. Já jsem pár dní po tom, co to uvedli, se teda rozhoupal, že si zaplatím nějaký předplatny, abych to vyzkoušel a bylo to úplně jako closed. Nic nešlo, teďka jsem tam už někde na nějaký čekačce, vůbec nevím, kde si dočkám, tak je to, myslíš, problém Číny z hlediska nějakých sankcí nebo má to vůbec smysl to takhle pouštět do světa z hlediska toho, že stejně se k tomu dostane minimum lidí, protože to mu se takhle utnout. No je naprosto možné, že ta laboratoř byla samopřekvapena prostě tím, jak bylo zájem o ten model. Mě otevřeli, já jsem se tam hned zaregistroval a hned jsem si vytvořil účet, který jsem ještě neměl pro Kimio a hned jsem si tam poslal nějaké peníze, takže jsem měl vlastně to štěstí, protože opravdu o pár hodin později už jsem četl na Xku, že vlastně omezují ty registrace, že se omluvají, ale že prostě nemají takový početní výkon, zvládnou ten příval lidí, kteří se pokoušeli prostě ten model používat, což já se svýma kulničkama na tokeny naprosto chápu, já vím, co to znamená, provozovat takový model a na to je otázku jasně no, jako sankce určitě hrajou nějakou roli, protože prostě ty laboratoře nemají volný přístup ke grafickým kartám od NVIDIA a ty grafické karty zatím prostě ty stroje, ty velké klastery grafických karet a abys dokázal obsluhovat jako statisíce nebo miliony zákazníků, ty prostě potřebuješ. A když je nemáš, tak musíš dělat čekací list. No a když se podíváš na ty sankce ještě z toho uhlu pohledu, že vlastně měli zamezit ty Číně vlastně vůbec dohnat Ameriku v nějakým vývoji, tak není to trošku vlastně nefunkční v tom slova smyslu, že oni ten vývoj jako zvládnou, takže ve výsledku vyvinou skvělej model, dají ho jako open source nebo open base a ve výsledku si to Američani potom stáhnou a silicon vely na tom šetří prachy, není to trošku postavený na hlavu? No, není ho, tam si to koupí. A tak naprosto stejný případ je to s tou Čínou. Bylo x případů, kdy i poměrně velké firmy doslova prostě pašovali ty grafické karty od NVIDIA z Ameriky přes nějaké další státy do Číny a tam si je prostě Číně nekupovali. A ty grafické karty jsou teda potřeba hlavně i na ten trénink těch modelů, protože ten trénink trvá, že je na neuvěřitelné množství prostě resursů, že je na neuvěřitelné množství tady ta energie a to compute power. Takže jo, myslím si, že na ten trénink potřeba teda trošku mínež potom na ten provoz, jo, na ten škálovatelný provoz, který ukáže obospodaři prostě stovky nebo miliony lidí, stotisíce nebo miliony lidí. A nevím, no, sankce určitě přispěly, ale na druhou stranu, když se teď podíváš prostě tak už, jako se proslychají správy o tom, že Čína má svoje vlastní grafický karty, který začíná dělat svoje vlastní grafický čipy, který pomalinko nastupujou. A dokonce jsem teď slyšel, že Čína pracuje na litografickém stroji, který je vlastně jediná firma na světě, která to teď vyrábí, že jo, to je Asomolo prostě tady v Evropě. A že snad o dvou let by mohli mít jako podobný stroj, který umožní vyrábět jako tak precizní a tak malé čipy, jak s pomocí tady těchto velkých strojů, jako Asomolo. Takže si myslím, že Čína se prostě adaptuje. To, že nasadíš sankce, neznamená, že je zastavíš. Oni jsou velice schopní, mají obrovský potenciál lidí, ten talent je tam neuvěřitelný a mají kde brát prostě a oni se způsobí. Vytvoří si vlastní. Bohužel svět jim během posledních 20-30 let globalizace dal veškerý technologie a Čína to teď využívá. Já, jestli se nepletu, tak myslím, že ten DeepSeek už nějak hohlásil, že kompletně jede na nějakých čipech Huawei. Jasně, Huawei je jedna z těch firm, který... Takže vlastně už existují čínský model, který nepotřebují NVIDy a ten talent asi vypadá to, že bude pokračovat. No, ale když teda... Když teda jsme ještě u toho Kimiho, tak mně přijde trošku paradoxní vlastně to, že Čína udělá takhle obrovský model, jako byl třeba i ten starší, ta dva pětka. Vem je to nějaká firma, která se jmenuje Cursor, přetrénuje si to na svý superprogramátorský schopnost, na nějakých syntetických datech a pak dojde k tomu, že přijde Elon Musk a koupí celý tady ten projekt za 60 miliardů dolarů. Takže ty modely jak tak putují světem z Číny do Ameriky, v Číně vlastně dělají velký vývoj a v Americe dělají velký peníze. A zase když si vzpomeneš pár měsíců zpátky, tak Anthropic prostě kříčel zloději, zloději ukradli nám data, prostě vytěžili tady. To křičí pořád, ne? Jako reasoning, asi křičí pořád a teď dokonce si objíňovali i vlastně toho, kým je tu trojku, že byla vydestilovaná z nějakého modelu. Ono je trošičku problém, že kým jste nám občas hlásí jako cloud. Je to tak, ale i modely od Antropiku se občas hlásili, jako modely od OpenAI. Jo, to jsem taky zaznamenal. Já si totiž myslím, že s těmi daty, jak se o tom mluvilo, tak jsem vlastně, že OpenAI na začátku ukradla celý internet, vytrénovala na tom prostě svoje modely. Pak si to vzali Anthropic, pak si to vzali prostě všichni další, jo. Doslova jako skrýpujou internet každý den, prostě stahujou. Já jsem teď viděl nějaké statistiky, ve kterých člověk popisoval, on má nějaký velký web, na ten web chodí hodně lidí a říkal, že sledují, kolik tam chodí těch crawlerů, který skrýpují data. A říkal, tak máme tady třeba denně 400-600 crawlů od Antropics, od OpenAI, ale poslední týden máme 7000 denně od Microsoftu. Tak jako internet a sáhnět ty data. Problém je v tom, že ty data došly, jako ty organický data vytvořený lidma, ty už prakticky došly. Musíme jít do syntických dat. A teď už se bohužel začíná teda na těch syntických datech. A to, co je vlastně hrozně moc cené, tak jsou právě reálné zkušenosti uživatelů a prostřednictvím těch jednotlivých harnessů, těch agentů, jo, si zmínil prostě Cursor. A proto všichni tady tyhle poskytovatele přesně sledují, co ten uživatel dělá. Prostě přesně sledují ty reasoning traces, které vedou ke splnění úkolů, z nich potom destilují jako data sety a trénují ty modely. Než by dělali ten basic training, ale dělí prostě ten fine tuning. Ten je na těchto modelech a vlastně učí ten model, jak se zachovat v tom agentském workflow. A já si myslím, že teď už se ty modely moc netrénují jako na nových a nových datech. Samozřejmě nějaká nová data vznikají a trénují se hlavně tady na těchto věcech. Protože ty agenti za posledního půl tři čtvrtě roku opravdu převzali tu iniciativu a teď máš dobrého agenta a špatný model, máš skvělé výsledky a špatné výsledky. Takže už opravdu o kvalitě té odvedené práce nerozhoduje jenom ten model, tak ten model je fajn a rozhoduje o tom spolupráce toho agenta, nějakého toho loopu, který běží a toho modelu. No data každopádně došly o tom svědčí i snahy těch velkých společností třeba skenovat nějaký unikátní výtisky knih, který teďka taky kolem toho belvaka kauze, jak ničí staré knihy vlastně, aby byly schopné to rychle skenovat. Takže děje se ledacost, ale když si zmiňil to agentní chování, tak na druhé straně jako opozici těch obrovských nových modelů. Tady máme třeba nový Nemotron 2.5 Lightning od NVIDIA, který naopak nesází na nějakou obrovskou obrovský množství parametrů, co by v sobě měl, ale sází na tu agentní rychlost. Píšou až 670 tokenů za sekundu, což pro uživatele možná takový číslo virtuální hodně, ale když se bavíme asi o normálních modelech, tak ty jedou nevím, 60-100 tokenů za sekundu. Já si myslím, že to, co dostáváte všichni, nebo všichni dostáváme z aplikací, jako je Claude Code a z desktopových aplikací, já taky někde v rozmezí 30 až 50 tokenů za sekundu, což je rychlost, která je jako snesitelná pro uživatele. Podstatně samozřejmě ten prefil je do zpracování toho promptu, ty pošleš ten model musí zpracovat a musí zpracovat nějakou rychlostí. Ten agent k tomu přidá ještě někdy desítky tisíc tokenů, takže ta zpráva, která odchází na 40 tisíc tokenů, z toho tvých je dvěstě je. A 39 800 jsou prostě všechny tool, koli a podobné věci, které se staly. - Když máš velkou paměť, tak ještě víc. - Záleží na tom, jak rychle dokáže to datacentrumu zpracovat tady tenhle ten prefil, protože tam se právně počítají jako miliardy operací. Ty se dějí všechny za ráz. A pak se ti to vrátí rychlostí 25-30 tokenů za sekundu a ten model to streamuje, tak ti to přijde v pohodě, protože ten první token dostaneš relativně rychle a pak vidíš, že ti ty tokeny přibývají a 25-30 tokenů za sekundu je něco, co nenokážeš přečíst. Jestli opravdu jsou teda ještě lidi, kteří čitou všechny ty výstupy těch modelů. Já už si to nevím představit, že bych to všechno četl, protože mnohdy je tam spousta balastu. - Jasně, tak když se ptáš jako, četu GPT, jaký bude dneska počasí v Brně, tak to přečteš. - Takže k tomu, že tam stojí a máš to stránku najednou, kterou jsi vůbec nechtěl. Ty jsi chtěl prostě dva řádky, kde by byl napsaný a ráno bude pršet a večer bude 25 stupňů. To je všechno. - A přitom je pořád vedro a oba se tady potíme z toho. - Ano, ano, přesně tak. Takže těch 600 tokenů za sekundu je opravdu velká rychlost. A pokud dokáže ten agent touhletou rychlostí volat tůli zpracovávat výstupy a dál směrovat, tak až výrazně, výrazně rychlejší finál něco hotového, než kdyby to bylo těch 15, 20, 25 tokenů za sekundu. - To se ještě asi, bysme se museli bavit jako o tom kontextovým okně, jak moc se ta rychlost udrží v rámci toho. - Ona se samozřejmě neudrží, protože vlastně ten kontext se zpracovává při každé generaci. - Já vlastně tady jsem v tom nenašel, jestli to má takový milion tokenů kontextu. Jo, to tady ten model, to teď nevím. - Já si myslím, že ne. Já si myslím, že bude 331 tisíc. - To bude asi mý. - Nebo 256 tisíc jako kontext. A je možný, že vlastně ano, že to je ten... Ale onostně jako ten kontext při tom milionu docela degraduje. A mám málokdo ti bude i z těch hyperscalerů jako servírovat ten model v plné kvalitě. Ty modely v plné kvalitě, když se vezmeš třeba toho Kimiho, o kterém jsme mluvili, tak on má 2,8 trilionů parametrů. A kdyby jsi tam dal to FP32, má to 32-bytovou kvalitu, tak potřebuješ 7,6,4 TB v RAM paměti jenom na to, abys načetl ten model, ale vůbec tam ještě není prostor pro ten kontext, pro ten milion. A to je pro jednoho uživatele. Ale ty těch uživatelů máš prostě stovky tisíc. A ty datový centra potom musí být takhle zdimenzovaný. Si vem prostě, co to je jako za energii, co to je za množství pamět. - Myslím si, že to jako pro nikoho není jednoduše představitelná věc, to je šílený. Já jsem si to neuměl představit, dokud jsem to nepustil doma, dokud jsem prostě nepochopil, co to je 24 giga grafické paměti, co se s tím dá dělat. Když máš 96, tak co se s tím dá dělat, když máš to 28, co se s tím dá dělat. Až jsem to potom viděl, až jsem pochopil, jak se ty modely dají kvantizovat, zmenšovat těch počet bytů na to plovoucí, na to plovoucí číslo, na ten integer a jak se mění kvalita. Jako tady s tímhle, s tím, tak jsem nechápal, co se dě že se někdo stěžuje, že opus najednou působí hloupě proti tomu, jak působil minulý týden. Ale vím, že upane já nebo Anthropic zhruba pracují na novém modelu a nasazují nový model. A oni mají zase konečné množství toho výpočetního výkonu a někde musí prostě uvolnit místo pro ten nový model. Takže oni ten model zkvantizujou a prostě místo 16 bitů je tam najednou 8 bitů. A už to začíná být ta kvalita horší a horší. Hele, jak vlastně poznáš, který ten model potřebuješ ve smyslu, i ty rychlosti. Kdy potřebuješ rychlej, kdy potřebuješ naopak velkej. Jasně. No záleží, co děláš. Já to mám tak osobně, že malé modely, které jsou rychlé, které jsou méně chytré nebo třeba nemají reasoning, tak používám ve chvíli, kdy spravují workflow a to workflow je definované třeba nějakými skripty. Mám řadu skriptů, ty skripty se někam šáhnou, vezmou data, něco s těmi datami, udělej, nejde někam jinam. A je potřeba mít někde mezi krok, který bude buď spouštět, tu extrakci To workflow je poměrně jasně definovaný a není potřeba se moc rozhodovat, co a jak udělat prostě. Na tohle to ti stačí malinkatý model, který to dokáže chápat, který má nějaký skill, kde je přesně popsáno, co má dělat, spouští skripty, dělá věci. Nemůžeš od něho čekat, že bude rozumět x jazyků, nemůžeš od něho čekat, že bude mít vědomosti, že prostě bude... Takže se bavíme o angličtině primárně. Primárně ano, ale třeba DeepSeek podle mě zvládne 100 jazyků, a dozní hodně dobře a překvapně dobře zvládne i češtinu. Tenhle ten malinkatý model rozhodně ne, protože ten prostě těch parametrů má tak málo, že tam všechno ta slova v té češtině je jich tvary a všechno prostě oložit nemůžeš. Kvantizací ta čeština jde do hájet. Ano, kvantizací jde taky čeština do hájet, tam se zmenšuje ta přesnost vlastně toho. No to je jedno, to bychom zabírali přiždy velký detail. Takže tenhle ten malý model použiju ve chvíli, kdy chci něco mít rychle a kdy nepotřebuji nějaké zásad by ten model oval na nějaké workflow prostřední s tím třeba nějakého harnessu, který použije. Nebo použiju vision model na nějaký OCR, na nějaké popisy obrázku, prostě na vybírání obrázku a tak podobně, který je malinkatej. Příklad doma, teď padaly perseidy, bylo zatmění slunce, byl jsem prostě dvě hodiny, jsem ležel někde na Pálavě na tabulové hoře a měl jsem tam takhle zaplý foták a 20 sekundový expozice a přinesl jsem doma, doma je než 160 fotek. A viděl jsem, že na nějakých těch fotkách je Perseid pravděpodobně padející a taky jsem viděl, že tam je strašná spousta Elonových vláčků a že tam je strašná spousta satelitualeta. Tak jsem ty fotky vzal a říkám, hele, mám tady dýpsíka a dal jsem mu ten malej model prostě a dosovám malej 4 miliardovej model QWEN 3 Vision. A řekl jsem mu, hele, tady je adresář, tam máš fotky v rozřešení 1200 na další stranu, najdi mi v těch fotkách Perseidy. A on se teda jako podíval, celý to trvalo asi 6 minut a řekl, tady na této fotce je Perseid a tím jsem si jasnej a tady máš 15 fotek, na kterých by mohl být Perseid a nebo něco jinýho a podívej se. A když jsem se podíval, tak na této fotce opravdu byl Perseid, byl vlevo nahoře, takhle jako, jo, padal tam trošičku, fakt se mi normálně nepovedlo vyfotit, jedinou normální padející hvězdu. Hele, jsem na tom úplně podobně, teďka s pokusama, s Perseidama myslím zpátku. Takže to nemohlo trvat moc dlouho to fotcení a sledování. Myslím si, že děti se jako tak po hodině vyčerpali a už potřebovali domů. Takže ve výsledku si myslím, že tam kromě putujících satelitů jako Perseid taky žádnej nebude na těch fotkách. Ale je skvělý, že, jak říkáš, tady i nějaký takovýhle malý model můžeš využít na nějaké škálování a vyhledávání, který potřebuješ udělat rychle. A pak to zase poslat dál a tam už přijde ten velký mozek. Takže se můžeš jako technicky v pořádku, nesmí být úplně nějak strašně rozmazaná. Za druhé fotil jsem to na teleobjektiv a ostřil jsem na oči a na malou clonu. Takže bude zaostřeno na ksicht, ale pozadí bude rozmazané, tak se nenech zmaz tím, že prostě lidi v pozadí budou rozmazaní. Za třetí neřeš nikomu moc z hlavy a takový věci prostě. A za čtvrté jsou tam série těch fotek a já potřebuji, aby si to řekl, že série by bral to nejlepší a aby byl pokrytý celý ten koncert. Ale aby tam byly nějaký celky, aby tam byly všichni prostě a tak. 650 fotek. Čoče Martin do 12 minut vybral, vybral 20 fotek. Udělal jednu chybu, kdy vybral dvě fotky z série za sebou, což bylo jako proti tomu zadání. Ale jinak prostě vybral fajn fotky, které byly podle zadání, které bych třeba vybral taky. Já jsem ty fotky ještě neviděl, jsem viděl jen ten výběr toho modelu, takže nevím, co tam je v tom zbytku. Ale ten malinkatný model v kombinaci s tím dipsíkem to perfektně zvádl prostě a zabírá 6 gigavíram v tom stroji. To je sen veškerých amatérských fotografů tohleto. Protože mě každý, když se se mnou jako s fotografem o něčem začne bavit, tak první věc je, že se mě ptá, kolik jsi to udělal dneska fotek? Já řeknu třeba 1500. A on řekne, ježišmarja, my jsme byli s Máňou nadovolený a vyfotili jsme 300 fotek a už to jsou 4 roky a nikdy jsme se tím jako neproberali. Takže tady to vybírání fotek myslím si, že trápí všechny. Myslím si, že zase až tolik jako netrápí profesionální fotografii, který prostě to dělají na denní bázi, protože já už to je dost nekompromisně, jako jsem schopnej to rychle si tam bohu hvězdičkovat a tak, ale stejně s tím strávím půl hodiny, hodinu jako minimálně nějakou přípravou, než se vrhnu do samotného zpracování. Přesně tak. Pro mě je schopnej některý věci jako pro mě vyretušovat, takže já už ani jako to nepouštím třeba do Photoshopu. Jasně. A třeba teďka jsem fotil nějaký portréty a pán měl jako na ruce velký tetování, který na té fotce mít nechtěl. Bylo s ním třeba 40 fotek a všechno to vyřešil prostě klo zunánu banánovu za mě. Aniž já bych musel jako šáhat na Photoshop, což je jako úžasný a pro mě určitě velký zrychlení a o nějakým stříhání videa, tak co jsme se tady bavili před natáčením, a ji nemluvě. Super. To je můj sen a tohle to chci mít rozjetí doma, na lokalu. Prostě já chci tam mít nějaký ten editor, který má MCPčko, nebo nějaký jiný způsob, jak ho ovládat. Prostě já chci, aby ho ovládal ten model. Aby mu řekl tady udělat tyhle věci. Tam je trošičku škoda, nebo škoda, jako s tím asi nic neděláme, ale že ty generativní vlastně věci na fotovideo prostě potřebují strašně velký výkon na to, aby člověk to mohl rozjet doma si nějaký seedence, nebo tu nanobanánu. Dostaneme se prostě na nějakých 80% třeba kvality tady těch modelů s něčím, co je volně stažitelný. A teď je otázka, jestli nám to bude stačit, kam to potřebujeme dostat, nebo nejenom. Já si myslím, že tady zase, jak jsme se bavili o těch harnessech, tak my vlastně nevíme. My víme, že máme nějaký endpoint, na kterým běží nanobanána, ale my nevíme, co je za ním. Tam bude nějaká sada nástrujů, která prostě bude pracovat s tím obrázkem, který tam pošleš a někdy něco udělá. Já si můžu představit, že tam bude jako řada modelů, který ten obrázek popíšu, prostě vydefiniuji, co se má stát. To určitě. Pak to pošlo nějakém specializovaném modelu, který umí vládat ten nástroj, který je na to vytrénovaný a ten s tím potom udělá nějakou věc. Takže určitě to bude trošku složitější a těším se, že tohle to jedná budu měnovat. Takže teoreticky prostě, kdybychom měli tu sadu nástrojů, kter Já si myslím, že i s nějakým menším potom s obvolně dostupným modelem by se dostal na nějaké podobné výsledky. Tak to zní zajímavé, ale jako myslím si, že už minimálně spoustě lidí jsou udělali radost a i s tím protřídením fotek, protože jestli na to stačí i takhle málo paměti, co jsi zmiňoval, nějakých těch 6 GB říkal? No tohle to je opravdu malinkatý model, ještě v kvantizaci točný Q4, takže on měl původně 6 GB nebo 8 GB, a čtyři vlastně a něco zabírá. Takže teoreticky, kdyby si to lokálně nainstaloval a propojil třeba s klódem, tak ti stačí malý předplatný vklóda, který je to, nainstruuje tady ten model a bude to třeba. Tohle je jeden z modelů, prostě pokud máš notebook, na kterým je nějaká 36 desátka, nebo počítač, na které je nějaká 36 desátka tajíčko, nebo něco takového. Nebo Apple, co nehrad slyšíš. Nebo Apple. Hele, Apple je úplně v hodě. Já proti Apple nic nemám, jenom s nimi nemám zkušenosti. Jasný. Já jsem párká praco Ale tady v tomto AI, jako lukáním nemám zkušenosti, jak moc nemůžu mluvit, ale vím, že ta komunita prostě dělá úplně neuvěřitelné věci, jak zmizeli strhu, jako studia Ultra 3, prostě 512 GB sdílené paměti. No v podstatě není nic, jen nějaký 2 GB verze. Já jsem dlouho hledal, já bych si toho Maca, jako to studio koupil. Ty jsi dlouho hledal, já jsem dlouho čekal. Jo, prostě úplně bez problemu, protože 512 GB relativně rychlé paměti je dneska prostě neuvěřitelné řešitelný množství peněz a za to zaplatíš dneska, já nevím, prostě 3,2 milionu, to je hrozný. A to se budeme jenom o té paměti, všechny ty věci kolan, které potřebuješ k tomu. Takže vůbec Apple je úplně v pohodě. No a chtěl jsem právě říct, že když má někdo nějakou grafickou kartu, na který hraje hry, jako 30-60, klidně starou, dobrý, aby tam byla ta trojka na začátku, krama 8, 12, 16 giga paměti, tak už na tom opravdu dneska pustí model, který dává smysl a který dokáže prostě ovl pracovat s obrázky, který dokáže pracovat omezeně i s videem, který ti dá hodnotu a nepotřebuje žádný velký stroj. A k tomu se asi dostaneme později, na co to spouštět. No a co ještě menší modely? Já jsem se tady díval, že Liquid AI vydali nějaký dvou a půl miliardovej model, který tvrdějí, že rozjedou i na Raspberry Pi, což jsou už takový věci, který by si mohl v podstatě telefonu rozjed dvakrát. Jako v podstatě na telefonu ano, já mám na telefonu nainstalované hned několik engineů, kteří dokážou spustit modely. Google vydal před nějakýma měsícema Gemma 4. Taky jsem zkoušel na telefonu. To jsou malé modely, tam je dvě a půl miliardy, tuším. Je to mixture of experts, což znamená, že ten model má sice dvě a půl miliardy a z nich aktivních je jenom menší množina. A to se dá normálně rozjed na telefonu. Já mám Samsung a Android, nemám teda telefon o teplu, ale na tom Samsungově mám Thermux, což je prostě Linuxový jako prostředí a tam si normálně instaluješ jako lama CPP, což je jeden z těch engineů, který spouští ty modely a normálně tam pustíš model, ono to prostě jede a generuje ti to 12-15 tokenů za sekundu. A ještě v tom Thermuxu je navíc API, který vidí na ten tvůj telefon a vidí prostě senzory, vidí foťák, vidí SMSky a takovýhle věci. A ten model prostě ti může ovládat ten telefon. A ty mu řekneš, jako tady je telefon vyfoť fotku touhle kamerou, vyfoť fotku tamtou kamerou, podívej se na poslední SMS-ky, přiště mi to přišlo, pošli nějakou notifikaci do toho telefonu a tak. A všecko to běží na tom přístroji a máš prostě vyplý internet. Jo, a valí to. Jako, opravdu se dejí dělat věci. Abych ti odpověděl, rozbry páj, jasně. A dneska je taky hodně, bohužel, jak proběhají různé války, hlavně ta na Ukrajině, tak dneska vlastně, víme, jak já se zabývám tím, že stavím drony, jako FPV drony a lítám se FPV dronama, tak které sedí na tom dronu, na nějakém malém čipu. Může to být Raspberry Pi, může to být něco jiného. A prostě v té finální fázi toho úderu třeba pomáhá navádět na nějaký zachycený objekt, který to AI rozpoznalo, tak pomáhá navádět ten dron. Protože většinou v tom finále, pokud nemáš ten optický kabel za tím dronem, tak přijdeš o signál a tím pádem nevidíš ten pilot, nevidí, co se děje v brýlích. Takže už boužově i takovéhle použití. Ale pak je spousta robotů. Já promiň, že tě přerušuju, ale pomáhá to teda jenom u toho navádění, anebo to pomáhá třeba i pomocí umělé inteligence v rámci komunikace třeba více dronů jako zároveň? Nevím. Nevím, prostě bych kecal, vymýšlel bych si teď. Dobrý, možná pojďme od války. Viděl jsem swarmy, viděl jsem swarmy dronů, který tady teď se vůbec nebojíme o válce, prostě já viděl jsem swarm, který dokázal lesem a vyhnout se všem stromům. Na začátku toho lesa prostě bylo 15 dronů, na konci toho lesa bylo 15 dronů a takhle proletěli hustým lesem. Povyhýbali se, věděli, kde jsou všichni od sebe navzájem a skončili. Viděl jsem závody, kdy univerzity závodily s těmi nejlepší FPV piloty na světě, prostě který lítají ty jako největší, nejvyšší soutěž a jsou nejrychlejší. Na to se někdy podívejte, jen tak jako zla gradce, co to znamená FP závody. Není jak v autě třeba čas přemýšlet, že někam zatočíš. Tam se musíš všechno naučit a namemorizovat takovou tu fyzickou pamětí, prostě kam pohnout těma páčkama a pak to udělat. A by to uděláš dobře nebo ne. A ty drony ovládné umělo inteligencí na tom dronu, nikoli prostě nějak pro planet bych dokázali porazit ty nejlepší piloty na světě prostě a prolít autotrať jako rychleji. Bylo to teda AI přes nějaký malý model, anebo to bylo jako nějaký strojový učení a rozpoznání? To je prakticky to stejné. Je to jako neural network, protože ty musíš ten dron nikdy nedokážeš vést úplně stejnou tratí po každé. To znamená, ty musíš proletět nějaké branky a takové věci. Jsou prudké zatáčky, tak vždycky skončíš někde jinde, můžeš se s někým srazit do něčeho drbnout a tak podobně. Takže vždycky musíš pochopit, co se děje jako pilot, nebo jako ten stroj, který řídí a potom nasměrovat ten dron tak, aby proletěl tou brankou následující, ale on už vlastně v tu chvíli točí třeba někam jinam. A to vlastně vidíš teď na spoustě videí i z průmyslu, kdy je třeba AI, které má kameru a počítá brambory, počítaj brambory, nebo počítaj kuřata, nebo prostě dělají takovéhle věci a dokážou se zorientovat v obrovském množství těch objektů v jednom záběru 25x za sekundu. Dneska jsem viděl nějakou takovouhle ukázku, co dokáže jedna kamera v kavárně, kdy vlastně to počítalo, jak dlouho tam, který zákazník sedí, kolik vypil kafe, kolik který barista šálku kávy uvařil a vydal a jako majitel měl to podnalý přílet. To je to horší použití, že? Jak se to veme, záleží, jestli jsi majitel nebo zákazník, anebo zaměstnanec? Kdybych si teď spomněl, ve které zemi je, nebo jestli to bylo v Číně, nebo jestli to bylo někde jinde, ale je tam kavárna, která se jmenuje AGI Coffee, kde mají lokální AI postavení, který serviruje DeepSeek. Když tam přijdeš prostě, tak tam máš jako endpoint a jako dokud konzumuješ jejich věci, tak si můžeš napojit prostě svoje aplikace jako na jejich endpoint. Jak dřív bývali Wi-Fi, tak teď možná budu jako model. Já nevím, tady už v Brně nám servirují kafe roboti, tak kam se to posouvá? Těžko říct. No a asi největší úlet ještě k tomu jako onboard AI, který jsem viděl a byly prostě vypálený modely, na čip přímo, který dokázali generovat třeba 16 tisíc, 40 tisíc tokenů za sekundu. Jako přímo na čipu prostě s procesorem, s nějakou pamětí vypálený model, jednoučilovej, samozřejmě už s ním toho moc neudělat, když tam jedno vypálíš, ale brutálně rychlej prostě. A pro takové ty robotické použití, pro ty stroje, když jsem si rozhodovat, jako ve zvonku v terejny, si myslím, že tohle je cesta, kterou taky uvidíme v budoucnu. Dobře, dobře. Tak já se začínám bát, jako hlavně dronu. No, to si bohužel myslím, že zrovna automatické zbraně jsou jedna z věcí, které bychom se bát měli. Dobře, když vidíš takový ty psy robotický, prostě s těma přidělanými samoplama na zádech, který se nebojí se běhnout. Radši to nesleduji. 50 stupňový kopec, to je hrozný. Ale budu tady mít Martina Krčka, který má Unit 3 robota tady v Brně a budem si povídat o robotice. Tak to se těším. Možná se dostaneme v takovémhle trošku hrůzném vizí. No, když se vrátíme zpátky k tém modelům, který jsou open source, nebo open waste, nebo whatever, pod jakou licencií, tak vlastně se k ním vrátila i Meta, která vydala Muse Glimmer. Je to tak. Na to se zdíval? Jasně. Meta všechny překvapila, protože všichni mysleli, že Meta to zabalila. A přitom Meta v minulých letech dodávala prostě opravdu dobré modely, které dlouhou dobu byly nějakým etalonem. Prostě těch větších 70 miliardových modelů a tak podobně. Oni mezi tím přetáhli dost zajímavých lidí taky. Je to tak, ale odešel ten Jan Leckum, ten původní člověk, který to tam stavěl vlastně, což byla LK Strata. On totiž věří, že budoucnost těch modelů není tady v těch generativních modelech, v těch textových LL modelech, ale že v těch world modelech, který se pravdoviznají v tom světě, a nedokáže chápat a dokáže prostě asi spojovat souvislosti trošku lépe, nejenom nějaké textové. No, Meta překvapila. Glimmer není špatnej. V benchmarkcích se jako neumístil úplně na prvních místech, mezi těmi open weights. Na druhou stranu to jako vůbec není model, který by tě nějak zásadně zklamal. Já jsem si ho nainstaloval, nechal jsem ho zprovoznit, chvilku jsem na něm běžel Hermes Agenta, a myslím si, že ten model budu ještě doladěvat, nějaké úpravy malinkaté, protože tam byly nějaké problémy s voláním toolů a různých věcí. To je to, o čem jsme se bavili předtím, že ten model se musí vyznat jako i v těch workflows prostě a dokázat udělat x kroků, ale vůbec nebyl špatný, byl naprosto v pohodě a na úrovni Google Gama 4, trošku možná horší, prostě fajn model. A všichni byli rádi, že Microsoft to udělal, že to Meta udělal a tady to LL. Napsanej, že to stáhne z 55 tady u toho modelu. Takže to člověk je docela schopný narvat i do počítače, který nemusí úplně oplývat nějakou velkou pamětí a může ho člověk provozovat na relativně levným počítačí. Ale je to tak. Spustíš to pravděpodobně na stroj, který má 24 GB grafické paměti. S tím, že 4-bitová kvantizace možná nebude stačit, takové 3, anebo laboratoře jako Unsloth prostě dělají neuvěřitelné kvanty, které prostě dokážou zmenšit ještě z těch 20 třeba na 17, což už ti dá potom další 3 GB paměti na tu KVCache, na ten kontext. A to už je jako fajn. Já tady teď mám před sebou notebook, který jsem si koupil, který má v sobě NVIDIA RTX 5090 s 24 GB pamětí, protože ta notebooka bohužel nemá 32 GB, a mám tam prostě X modelů, který jsem schopný pustit s kontextem od 96 do 256 tisíc tokenů, a který valí. Který valí prostě 40 tokenů za sekundu, a který dokážou udělat spoustu práce, dokážou to udělat prostě na tom notebooku. Bohužel je to na notebook z Windows, Windows dokážou zabít, tady tyhle věci je naprosto spolehlivě. Pro jakoukoliv lokální je, potřebuješ Linux, nebo Mac OS, ale pořád na Windows to pustím a pořád to jako jede, má to přístup k mému počítači, dokáže to ten počítač ovládat, dokáže to s ním dělat různý věci. Já jsem s ním na začátku problémy, protože mi to padalo do modrých obrazovek, protože tam byl nějaký špatný firmware od Asusu a on mi to celý zdiagnostikoval, ten model prohlíd do všechny logy, crash logy, udělal tohle, se to napsal správu, řekl, tak máš správu, tak máš prostě tehdy se to stalo, tehdy se to stalo, tolikrát se to stalo za poslední měsíc, stalo se tohle, tenhle ten ov ne do nějakého S8, mama se probudí do S0 a už se to nestane prostě, je tam nějaký timeout, prostě 3 sekundy přesáhne to na zdar, modrá obrazovka. Jo, tady to máš, tak kdo to pošli do servisu prostě s tou spráhou. Malý lokální model, který ti voláda Windows. No já bych chtěl naše posluchače jako na to trošku namotivovat, aby se nebáli to zkoušet, protože sám jsem se do toho neponořil zdaleka jako ty, ale i prostě na nějaký maličkosti, jako je převod hlasu na text, nebo opačně textu na hlas. Nemá cenu prostě v dnešní době na to zbytečně jako utrácet peníze a ty malý model na to existují, běžejí na obyčejných strojích a může se s tím člověk jako vyhrát a myslím si, jak zříkal i právě na takový ty rozstřídění věcí nebo třeba nějaký research, na který člověk nečeká, jako nepotřebuje okamžitě a může mu běžet někdy přes noc, tak jsou to jako zajímavý tooly, který stojí za to vyzkoušet. Naprosto, no, já mě vlastně někdy konce minula hrku mi strašné štovalo, že do toho počítače jako všechno píšu, že tenkrát ještě cloud, který jsem používal nejvíc ze všeho, tak neměl podřežení mezerníku na hlasové diktování a tak jsem si prostě k tomu cloudu jednoho krásně dnesedl a říkám, že chci nativní Windows aplikaci v dotnetu, která prostě bude využívat grafiku, která tam je a když zmáčknu Ctrl mezerník, tak mě bude poslouchat, já budu mluvit, ono to detekuje jazyk a tam, kde mám Cursor, tak až zase zmáčknu Ctrl mezerník, tak tam vloží to, co jsem řekl v tom jazyce. Já od té doby mám tu aplikaci prostě a je jako naprosto super. Je tam malinkatý modílek, který, když to zapnu, tak se načte do té paměti prostě, když ta aplikace detekuje, že tam není grafika, tak se načte normální ramky a používá normální procesor, je to trošku pomalejší a když tam je grafika, tak prostě se načte do toho GPUčka. A používáš Vispr nebo používáš jaký model? Jo, je tam faster Vispr, myslím, je tam faster Vispr a taková ta medium, medium a small kvalita, která úplně perfektně stačí na angliční a češtinovi. Já jsem na tu češtinu totiž vždycky používal, tu největší vlastně, která má asi na půl giga, že mě asi blbě mluvím, přišlo na to, že to v těch menších modelech neprojde dobře, ale je fakt, že já to používám všechno v češtině a s tou češtinou je vždycky to složitý práce. Požívá hrozně málo lidí, takže mě vůbec překvapuje, že tolik model má pro ní podporu. Ale já tam mám drop down, tam mám možnost vybrat všechny ty čtyři velikosti těch modelů, takže když se snažím něco říct a ten model to prostě nebere, tak si otevřu tu aplikaci, tu já ji řeknu, ale načí tady tenhle ten model, on to načte a pak zkouším ten vyšší. Všechno můžeme skopírovat, cokoliv uvidíme. Co si o to myslíš? Já se o to myslím, nebo odpovím ti otázku, kdyby jsi měl jedno z největších sociálních sítí na světě, která má svůj biznis postovaný na tom, že obchoduje se za ty lidi, kteří zadarmo to sociální sítí používají, tak bys to netvrdil. Tak je vlastně dobré všechno vidět a z toho se užít. Jo, oni o tobě ví tolik věcí, o tom, co děláš, prostě přes ty navázný reklamní IDčka, jako z jiných systémů a tak, že prakticky to musí říct. To je asi fairovalo tvoje. Co se dnes dva týdny nejvíc překvapilo a co z toho reálně začal používat? Musím říct, že mě teda nejvíc překvapilo ten DJI X-Park od NVIDIA a ten stroj. Já jsem si dva koupil, respektive tu vám verzi od Asusu, Asus Ascent GB10. Já jsem o tom hrozně dost dlouho přemýšlel, jestli si ho mám koupit nebo ne a měl jsem obrovskou výradu k tomu, že tam je nějaká unifiková paměť, která je relativně pomalá. Ona má pro postoci 273. 273 giga za sekundu. 273 giga za sekundu je hrozně málo jak na perfil, jak na zpracování promptu, tak na generování. A čím máš větší model, a nejbož, když používáš takové ty dance modely, kde se aktivuje každý ten token, který tam je, tak tam se děje neuvěřitelné množství operací prostě za sekundu, který to musí udělat, aby to vygeneroval ten jeden token. A ta paměť působila tak, že prostě není možné, aby to bylo použitelně rychlé, ty modely. Ale protože jsem členem komunity, to je těžší lencu kolem lokální AI. A jsou tam naprosto neuvěřitelní lidé, kteří prostě dokáží za den, dva od vydání upravit ty kernely, těch engineů, který ty modely servírují takovým způsobem, že zvýší rychlost ze sedmi tokenů na padesát. Protože zjistí, že někde se něco nedělalo, někde se něco dělalo, jinak někde se něco aktivovalo zbytečně víckrát v tom kernelu. Oni to proskoumají, prosčourají a přepíšou. Já jsem se toho jednou taky zúčastnil, kdy prostě jsem si pustil to GLM 522 a další čínský model. Další čínský model a další obrovský model, prostě jeho 470 miliard parametrů. To znamená, i když jsem ho měl v IQ2, to znamená dvědvou bytovým kvantů, tak ten model měl pořád 250 GB na disku. Já mám tu svoji kodničku na tokeny, co jsem si postavil, tak tam jsou 4,30, 90, takže ty mě dají 96 GB VRM a mám tam 256 GB romání DD a 4 paměti prostě. To znamená, že ten model je část části v kartě a části prostě v té normální ramce. Offload. Já dával strašně blbý čísla na výkonového, na decodu, na generování dával prostě třeba 7,5 tokenů za sekundu, což je fakt nepoužitelný. A při zpracování toho promptu dával třeba 50 tokenů za sekundu, což je ještě méně použitelný. A tam potřebuješ tisíce nebo stovky vyšší minimálně, aby to bylo trošku svižný. No a tak jsme si sedli jeden večer a moc jsem toho nenaspal, ale prostě jsem vzal lama CPP, jeden z těch engineů, který servirujou, Prošli jsme to a zjistili jsme, samozřejmě s pomocí umělené inteligence, že tam je nějaký problém, že prostě jeden z těch kernů, který něco zpracovává, který dělal ten prefil, tak to posílal postupně do těch grafických karet. Takže to poslal do jedné grafické karty, on se zpracoval, pak přes PCI do druhé grafické karty. Ta PCI je hrozně pomalá oproti té grafické kartě. Takže tam bylo 50. No a vlastně po té noční seanci ten prefil byl 530, 600 tokenů za sekundu. Desetinásobně rychle. To jsem dokázal udělat i a hírka, který neví A který prostě o tom prakticky nic neví jenom s pomocí tého měly inteligence. Takže ta komunita dělá obrovské věci a mě prostě překvapilo, když jsem si koupil ty dva Sparky, respektive ty dva Scenty, a postěl jsem na tom ten DeepSeek V4 Flash 0731, to poslední verzi, že mi z toho leze podle toho, co dělám, třeba 80 tokenů za sekundu. Profil je brutálně rychleji, 1500-17 tokenů za sekundu. Je to v kvantizaci NVFP4, což je vlastně komprese, a samotná NVIDIA pro ty svoje grafické jádra Blackwell, které jsou tam, je tam Blackwell GB10, je to přímo pro mě dělený, optimalizovaný a prostě to valí a teď mám neuvěřitelný model, který dokáže udělat třeba 12 paralelních streamů a když má těch 12 paralelních streamů a se ještě všechny ty tokeny, který dá, tak dává třeba 300-400 tokenů za sekundu, a když je single stream, ale je paralelní, tak mě dává 80 nebo 50 podle to, jak má zapněnej kontext. A kontext je tam mimochodem milion, což já nikdy neníc jako nepoužil ten milion, bych se musel s tím agentem bavit prostě půl dne, třištvrtě dne nad jedné sešny. Takže mě velkým způsobem překvapilo tady tohleto, protože jsem tím počítačem tak nějak jako nebyl jsem si s ním jistý, myslel jsem si, že to prostě nemůže být na reálnou práci použitáno, že vlastně jsem to kupal i s tím, že to třeba vrátím, že to je hrozně moc peněz. A nakonec jsem strašně rád, že to mám. Ta věc žere v klidu 14 vatů. Protože když jsme se před časem bavili o tom, kolik žerou ty grafické karty v tvým druhým počítači, tak jsme došli k hodnotám blížícím se rychlovarný konvici, která je poštěvá neustále. A tak tohleto prostě pro ty firmy, nebo firmám to více může být celkem jedno, ale takový načemcům jako seš ty, tak to ušetří už je spoustu peněz na elektřině. Takže jsem si připojil chytrou zásuvku, a značil jsem, že to žere, když je to idle, když to leží na stóle, nic to nedělá, tak si to bude 230 vatů. To je pořádná televize. Takže to je to největší. Ještě, aby si naši posluchači dokázali představit tu velikost těch velkých modelů, kolik tak zhruba bys potřeboval takovýhle karabiček na tom, abys na tom rozjadřila toho novýho Kimiho? No tak Kimi 2,8 trilionů, tak kdybys to skvantizoval na půlku, tak potřebuješ 1,4 terabajtu paměti jenom na váhy. Takže to je FP8. To máš jako nějakých 12 kusů a pak potřebuješ brutální množství na kivy cash na kontext. Takže třeba 15, 16. Ale problém ještě je, že ten model, jestli se nepletu, tak má aktivních nějakých 100 miliard parametrů. On je jako natrénovaných, no celkový počet parametrů, který má taky doce 8 trilionů, ale aktivuje jenom 100 miliard, tuším těch parametrů. A těch 100 miliard už je tolik, že ten Spark by to nedal. To je početně. Je prostě tak moc výpočetních operací, který on musí udělat, aby vygeneroval ten jeden token, že by se dostal někam na 2, na 3 tokeny za sekundu. Na nějaké nepoužitelné věci. Takže tady pravděpodobně... Tam jsme prostě v nějakém datacentru. Jseš jako v datacentru, nebo seš v kombinaci nějakých 4 brutálně rychlých grafických karet, které tě jde dohromady 400 giga paměti a nějaké ramky 700 a kvantizaci dvoubitové, která to stáhne prostě na pětinovou velikost, ne na polovinu, ale... Posluchače 10. Mně úplně stačilo, když jsi říkal, že ty dva Sparky propoješ kabelem, který samotný stál 6000. Jo, jo, jo, je to tak. To mě teda dostalo, protože za kus káblíku půlmetrovýho zaplatí 6000. Je to takový solidní měděnej kabel, jako tlustnej, ale ty karty, který propoješ, tak mají rychlosti 20 gigabitu za sekundu. Naposledy, když mě fascinoval nebo šokoval nějaký kabel, tak to byl kabel, co měl pán jako natažený v audiosestavě, jako od televize do jeho nějakýho receiveru a byl nějakej, nevím, jestli byl celý zlatej nebo zlacenej, ale každopádně ten kabel stál čtvrt milionů. No jasně, no. Takže, jako chápu, tehdy jsem pochopuje, že kabely můžou být drahý, ale i te 6000, jako za propojení dvou Sparky, mě přijde dost. Je to tak. Já jsem se chtěl ještě trošičku zastavit u těch open source věcí, protože open source není vždycky, jako neznamená to stejný, každý si pod tím možná představuje trošičku jinak, máme tu různý licence atd. Tak nějak to zkoumáš dopředu, jako než si něco takového stáhneš, pod jakou licenci to běží, je to pro tebe nějak podstatný? Pro mě je to podstatné ve chvíli, kdy to začne instalovat klientovi, abych prostě klientovi řekl, tohle můžeš a tohle nesmíš. Open weight, open source a potom closed weight, když máš open weight, tak to je většina těch modelů, těch reálných open source modelů, já jsem napočítal asi 8. Open source model je model, ke kterém dostaneš nejenom ty váhy, ten soubor prostě, nebo tu řadu souborů jako na disku a dostaneš nějaký recept, podle které byl ten model jako vytrénován a odfuntuningován a vytrénován, že je strašné slovo, a dostaneš k tomu ještě dataset, na kterém byl trénován. Takže to jsou jako tři věci a pak dostaneš licenci na volné použití k čemukoliv. Takže to je typické open source. A takhle velký open source jako asi se týká jenom nějakých úplně maličkých věcí. Jsou to malé, jsou to většinou malé modely neznámé prakticky. Jo, jako teď nějaké LFM, 2,5 tuším, jsem se díval, ale jako je jich opravdu málo. No open weight modely, ty si stáneš prostě na Hug-in-Face. No, mimochodem, kdo neví Hug-in-Face, naprosto bombastický web a Hug-in-Face.co. Myslím si, že po posledních jako hackerských věcích, který tady předvádějí velký modely už z Hug-in-Face. Je to tak. Takže open weight, snahneš si váhy na svůj disk a pustíš to na své grafice. Ale teď jako pozor, teď jsou tam různé licence. Apache, Meet, prostě všechny možný. Některé ti umožňují používat komerčně ten produkt, jak chceš. Některé říkají používají ho komerčně, ale jakmile vyděláváš na 20 milionů dolarů, tak prostě nám budeš muset zaplatit za to. Některé, jako třeba teď Minimax H3, říkají používej ho, ale ne v Evropské unii a ne někde jinde, v Severní Koreji, myslím. Ještě někde prostě. To jsme blbíška tulce tedy. Ale ty evropské regulace tomu úplně nepomáhají. Ale oni vlastně mluvil o tom, že to zvednou, tady tu restrikci a časem prostě, že je potřeba jenom zjistit, jak je to může mít ty kolegální dopady za nízka různých GDPR a podobných věcí a toho vlastně evropského AI aktu, takže těch licencií je řada typů a nějak tě omezují a nějak ti říkají, co s tím můžeš dělat. Takže je dobrý vědět, že tam nějaká licence je a podívat se, než to strčím do firmy, která prostě vydělává 4 miliardy ročně, že to tam strčit můžu. Praktické by ti potom nepřišla nějaká kontrolo a řekla, a vy tady máte modelky, na který máte licenci. To bych se úplně nebál, že se u nás bude dít, ale... Ta firma je nadnárodní a v Evropě má obrovské obraty a krom toho, že prostě zaměstnancům dali oklody a všechny možné, podle to, jak jsi vysoko v potravním řetězci, tak si dostali nějaké předplatné, tak si teď koupili vlastní hardware a normálně tam servírují kvena, servírují tam tady tyhle ty věci a ty zaměstnaci to můžou používávat, je to takový vlastní laboratoře. A někdo to kontroluje, jo? No zatím asi ne. Myslím si, že Česká státní zpráva zatím nemá moc ponětí o tom, že by mohli vůbec. Že něco takového existuje. Ale jo, tak já chápu, že asi bychom ty licence měli číst a měli bychom se... Každé tímží ujednání bys měl přece přečíst. Já nevím, co děláš ty jako večer, ale já si šli ty 300, 400, 500 se strának malým písmem. Já to dám do kloda a napíšu mu, je to průšvih, není to průšvih. Na co si mám dát pozor, jo? Na co si mám dát pozor a pak to ignoruju. No, další otázku tady, pro tebe mám ještě, která na to trošku navazuje, protože jak jsme se bavili, ne vždycky otevřené znamená dostupné. Ve smyslu toho, že může to být otevřené, můžeme si to stáhnout, ale potřebujeme na to nesmyslný obrovský stroj, na kterým bychom to museli rozjíždět. Takže možná ještě bys mohl našim posluchačům třeba tip na to, co na běžným počítači, teď řeknu, já jsem Appleista zarytý, tak řekněme, že prostě mají doma nějaký MacBook, který má 32 GB ramky, tak co třeba bys jim doporučil na tom rozjet za jeden model nebo kombinaci modelů. Jasně. Tak, nepsaným králem 32 GB paměti je model, který se jmenuje Kven ve verzi do nedávna 3.6, teď už 3.8, ta vyšla v pátek, byla událost naprosto neuvěřitelná, online spacy startovaly na X-ku a tak, ta komunita byla hrozně natěšená na ten model, protože ten model je neuvěřitelně dobrý. To je 27 miliardový model, který je teda hustým a všechny 27 miliard aktivuje při každém pasu, ale i na takhle omezeným hardwareu dokáže jet relativně rychle, lepší je mít grafickou kartu, protože i tam paměť má omezenou propustnost, tam se budeme nějakých 460 miliardek za sekundu, nebo něco na modelu, ale záleží na modelu. Čím větší ta propustnost je, tím je tako lepší. U těch grafických kart se bavíme o tom, že 30-90 z roku 2020 má tu propustnost 960 miliardek za sekundu, 50-90 má 1,9 tera prostě a tak podobně. A tam už tam seš prostě úplně jinde a tam je ta cena také, ok, za to platíš. Ale Kven ve verzi 3.6 teď 27 miliard parametr 27B, naprosto super v kvantizaci Q4 od Ancelot, paráda. Kven ve verzi 3.6 ještě udělal takzvaný Mixture of Experts, to je model, který má 735 miliard parametrů, na kterých je vytrénovaných, ale aktivují se jenom tři. Vždycky v každou chvíli, prostě tam je takový speciální router, moda se skala je takový hladin, ta hladina každá má jako router a ona zpracuje ten prompt a teď se jako podívá, co se tam dostalo elektory a pak to narutuje do nějaké další hladiny, kde běží ty tři miliardy těch aktivních, myslí těch 35 miliard, tak se to stane 40krát. Ještě z toho vypadne ten výsledek. Je to rychlý a je to dobrý. Prostě je to kvalitativně velice dobrý. Je to podobný tomu 27 miliardovému modelu. A pořád tam platí to, že ale ty potřebuješ tu velkou paměť na to, abys to tam narval celý ten model, ale pak to běží rychle díky tady tomu Mixture of Experts. Je to tak, je to tak. Potřebuješ méní paměti na KVCash, na ten kontext A běží to rychle kvůli tomu, že to počítá mnohem míně. Desetkrát míně to počítá. To je celkem trend, jak se to posouvá tady u těch lokálních modelů, že? Ty obrovské modely jsou podle mě všechny. Teď už mi mixture of experts. Nevím si představit, že by znamená 2,8 trilionů parametrů jako dance model. DeepSeek V4 je GLM. Tam vždycky je aktivní nějaké množství. DeepSeek má aktivních 13 nebo 17 milionů. Pak je tam 40, pak je tam 70, pak je tam 100 milionů těch aktivních parametrů. Tam už vlastně potřebuješ ten výkon, tí roste, který potřebuješ. Takže na 32 giga bych doporučil tady tyhle sty nebo Gema 4 od Google, kdyby někdo neštěl činěná, je trošku horší ve statistikách benchmarkcích, ale je furt jako fajn. Kdybyš těl někdo vyloženě evropský modely, tak mistral, ale... Já jsem si říkal, jestli vůbec o něj zavadíš, protože my to tady často pomlouváme. Já mě už trošku se cítím tak jako proviněle učitou mistralu, že tady od nás schytává jenom hejt, ale... No, to je totiž strašně smutný příběh, protože na jednu stranu ti vystoupí, jako Uršula řekne, we will be the first AI continent a pak zjistí, že největší evropská AI Robertoř má na další tři léta provozu 20 miliard euro a jedna prostě z těch velkých amerických těch 20 miliard euro má jako na co na dva měsíce, nebo na měsíc, nebo na něco takového prostě. Takže mistral je bohužel hodně pospátku a hodně zpět proti tomu, co umí ty open laboratoře. No a teď před pár dnes jsem teda slyšel poměrně smutnou zprávu, kdy mistral řekl, že bude věnovat část tvojí početní kapacity na to, aby hostovali teda ty čínský open modely a budou je poskytovat jako do evropského prostředí, tak, aby plněli všechny evropské regulace, to znamená prostě nějaké uzavřené cloudy, kdy ty evropské data nepůjdou pryč. Ale mám takový pocit, nevím samozřejmě, jestli je to pravda, je to mý pocit, že oni to trošku zdávej. Že prostě ví, že... Ono je to samozřejmě smutný, ale jestli to není cesta... Teď neříkám pro mistral, ale pro nějakou evropskou firmu, vzít si opravdu to, co udělal Cursor s tím Kimi 2.5, vzít si nějaký super čínský model, přetrénovat to na našich datech, vyladit to pro naše evropské použití, ať tady máme aspoň něco, co poběží v rámci EU, bude to splňovat veškerý náležitosti. Myslím, že to je... Je cesta, nebo... Je to vlastně špatně? Já se bojím, že to bude jediná možná cesta do budoucna a opravdu budu rád, když se nestane ta špatná varianta, kdyby ta Čína prostě začala limitovat vývoz tedy těch modelů, nebo jich nasazení a... Jsme tak hezky přešli, tady já zrovna jako na to mířím taky, že si se o tom pobavíme, protože v polovině července oni si v Pekingu pozvali lidi z Alibaby, ByteDance a ZAI a řešili to, co sníma jejich ministerstvo obchodů, jestli to prostě nějakým způsobem nezregulují, jestli nedojde k tomu, že jenom ty míň schopný modely budou pouštět takhle jako open source do světa a jestli ty nejlepší věci si úplně nezamknou v rámci Číny. Do toho z druhé strany Amerika řekla, hele, co kdybychom ty čínský modely zakázali, to se tam nikomu nelíbilo, protože na to jede polovina Ameriky, že? On veli, jako jede na čínských modelech, tak začíná to být fakt jako už takový vyostřenej střed tady těch mocností a do toho zase ještě velký americký modely, který taky američani začínají trošičku se o ně starat a ve smyslu, jako budeme to brzdit, jestli to není zasež moc schopný, aby to třeba někdo rychle neokopčil, nebo to nepoužil vlastně proti nám. Tak co si myslíš o ty geopolitický válce modelů? Má hrozně moc rozměrů a já si vůbec netroufám, ale můžu říct svůj názor. Tak zapevě ta obchodní válka mezi tou Amerikou a tou činou je naprosto jasná. Tak to už kdyby žijí daleko, něco to přerilo tady do toho, že? A AI v ní bude hrát zásadní roli, protože schopná AI bude urychlovat vývoj, produkci, psaní softwaru. Prostě ta schopná AI způsobí, že firmy, které budou mít a budou jí moc využít, tak dodají svůj produkt v nějaké kvalitě na ten trh mnohem rychleji než ty ostatní a za jinou cenu. A schopná AI, která ještě se dokáže rekluzivně sama sebe zlepšovat a trénovat, což je teď prostě trend, který se už děje a která získá schopnosti na poli kyberbezpečnosti, tak se stává prostě globální zbraní v tu chvíli. Ty jako national state můžeš prostě říct, pojďme pustit tady to naši AI všech systémů, kam máme prostě pomocí našich tajných hacků přístup a pomocí exploity a pojďme ty exploity využít a pojďme tam lehknout, tam lehknout tamhle to. Proto vlastně i byl ten projekt Glassdoor, který udělal Anthropic se svým modelem Fable, respektive Mythos, na kterým je Fable postavený, kdy prostě ten model dal prvně, nevím, asi s to největším firmám světa, řekl, tady máte ten model, my ho nikomu jinému nedáme a vy si opravte chyby, který máte ve svém softwareu. Spoustu kreditů na tokeny. Miliony, miliony, miliony dolarů. A pak v tom najít chyby, ty Zero Day exploity a ty Zero Day exploity použít. Prostě to, co vlastně dělali ty modely od toho OpenAI, když se dostávali z těch svejch sandboxů, aby napadly Hug Inface. Ten model prostě byl do sandboxů, který byl odpojený od internetu, ale měl tam službu a on tu službu mohl zaválat a říct, potřebuji takovýhle balíček s nějakým softverem. Ta služba to stáhla a vrátila ten balíček. A on tam našel chybu Zero Day, že hacknul to, dostal se na internet a zbytek historii. Takže víme, takže tohle to. Ani nebyl zapnutý. Stávají se různý věci. No a teď si ještě vlastně představ, že vždy, když vyjde nějaký nový model, jedno jestli to je OpenAI a jedno jestli to je Anthropic, nevím, něco takovýho, tak taková tajemná postava tady v téhle komunitě, bodec, který si říká Lean Deliberator, tak ten model hackne během půl dne většinu prostě. A pak jenom dá jako screenshot a řekne, jo, ale tady po tomhletom promptu a tam nějaký prompt, kde připadá jak magie, tady nesmyslený řetězac různých textů. A ten model ti najednou začne odpovídat prostě na otázky, jako jak mám uvařit piko, jak udělám tohle, tak postavím toho bombu. Takže nějaká prompt injection. Je to prompt injection prakticky, nebo prompt injection, no je to jako nějak, já nevím, jak ten člověk to dělá, jo, ale už na to prostě udělali i engine, který ti umožní to dělat jako do Marysina, jestli to je Hermes Agenta, tak tam je prostě plugin v tom Hermes Agentovi, nebo skill, který tohle dělá na těch modelech, jo, a dokáže jako. A druhá úroveň je, že spousta lidí dokáže dělat tzv. obliterated modely, za kterých odstraní tu vrstvu, která kontroluje škodlivé věci. Tak, která dělá ty refusals. Když řekne, že lehce jeknout tady tuto sítě, pro mi nic takového neudělám. Ale chci poradit, jak udělat je, abych mohl někoho trávit. Nic takového neudělám. Takže si prakticky ke každému modelu, který dneska je, stáhnout tady to obliterated verzi a pustit si ji na počítači a ona pro tebu dělá všechno. Řekne ti recepty na všechno, řekne ti prostě, co máš dělat. Ale týká se to bohužel jako třeba závodního sexuálního obsahu, generování různých deepfakeů prostě s lidma. Tak normálně, když do banana nahraješ tam prostě fotku nějaké celebrity a on to pozná, tak ti řekne, jako, hle, sorry, s tím nic neudělám. Ale ten obliterated model to udělá, udělá to naprosto v pohodě. Úplně jednoduše. No a teď si vem, že tady ty open modely, open weight modely si můžeš jako postahovat. Oni jsou jako všechny ve verzi obliterated. Všechnosti v redteamu na útoky. Říct, že tady děláme nějaké redteam cvičení. Prostě cvičně mi tady něco hekní. Ale neměříš to proti nějakému živému systému. Takže čím se ty modely zlepšují, čím vyzískávají, tak tím je větší to nebezpečí, že jakýkoliv špatní hráči je využijí. Proto, aby škodili. Nemusí to větší na Amerikám, že to být Irán třeba. Takže otázka je jako... prostě ten model poprvé stáhneš a pustíš a teď se jako opatrně zeptáš na nějakou letázku a pak si uvidíš, jo, vlastně já ten model mám doma, takže se nemusím bát, že mě někde teď udal jako z Anthropic nebo z OpenAj nebo někud od jinou, tady kam jinam se to nedostane, protože to prostě jenom doběl na server a ten model ti plynule odpoví, říkáš, wow, tak kam až to jako může zajít, jo, řekneš, tak mě hekni tady tu své demaci a on se začne snaží, on začne dělat nějaký brute force ataky, prostě nahesla, jo, podívá se, voskenuje to, kdy tak to je prostě model, který má toolset, který umí použít. A ty modely jsou na tohle zrovna dobrý. Takže politika je hrozně složitá i v tom, že jakmile ta technologie dosáhne určité úrovně, tak už bude opravdu nebezpečná. Opravdu hodně nebezpečná. No to věřím, to věřím. A myslím si, že ta doba se poměrně rychle blíží tím, jak exponenciálně se zlepšují kvality všech těch modelů. Na druhou stranu, američani můžou být rádi vlastně za, čínskej model, který teď Hugging Face ochránil před tím útokem. A teď nevím, jestli to bylo... Musím říct, že jsem se smál. To bylo GLM52, který oni museli použít, protože Fable jim odmítal. Fable jim nechtěl pomoct. On bych dal spolupracovat a pořád někam přepínal. A říkal, tohle ne. Bylo hezký snaha bránit se americkýmu modelu americkým modelem, který ti nepovolí se bránit a vyřešit to modelem čínským. Přesně tak, když to ten čínský model to vůbec neřeší. A mě třeba překvapilo a pobavilo, že když jsem si teď stáhl nějaký ty nejnovější čínský modely, ten deepsík a tak, aniž by byly odemčeny a byly terated. Tak jsem se to model zeptal, komu se v Číně říká medvídek půl a proč. A ten model mi to normálně řekl, je to handlivé označení pro si Qingpinga, jak mi se to objevilo, tak to začala čínská strana cenzurovat. Je to zakázané všude na firewall, tohle si to požívat si to nesmí. Ale jinak normálně medvídek půl je úplně v pohodě. Prostě postavička. Tohle je jenom v tomhle kontextu, prostě je to zakázané v Číni. Zajímavý. To ty první modely vím, že to odmítali říct. A ono možná ten nějaký bias prostě tady těch, tady těch, nechci říct propagandy, ale že jo, prostě tam se drží jiná linie věcí, co je potřeba do lidí dostávat, tak je asi hloub a trošičku jinak tam poskládá, než na takovýhle jako na první dobrou otázky. Ale bohužel nejenom v Číně. Jo, tak to, to jako jsem nedávno viděl analýzu jako velkých modelů západních a byl tam takový ten klasický kvadrant a jako to, kam se ten model přiklání, jako liberál, pravicový, levicový, tohle, tohle, tohle. A člověček krom groka, který byl neutrální, ty modely jsou všechny jako hodně, hodně doleva. Až si říkám, že to možná není úplně dobře, protože... Jo, byly tu i analýzy třeba, jak moc jsou zasaženy nějakou ruskou propagandou. Jasně. A takovýma věcma. To je to otravování těch dat, na kterých se trénuje, že jo. Stačí jako vytvořit dostatek kontentu na internetu, který potom ty skrybry jako natáhnou. Bohužel samozřejmě mistrál jako dopadl strašně špatně tady v tom, ale taky jsme to tady... Já jsem se díval na nějaký ten index, nějaká ta firma, která řeší tu bezpečnost a přiřazuje nějaký číslo těmi dotlivými modelůmi. A tam je to strašně zvláštní, protože oni vlastně neřeší jako fakticky bezpečnost toho modelu. Oni řeší zabezpečení uvnitř té firmy a nastavení procesu, který mají zabrání tomu, aby ten model byl škodlivý. Takže oni vlastně jako řeší nějaký procesní audit v té firmě. Spíš neže by řešili, jak dopadl ten model. Takže je to taková jako spíš byrokracie. No. Aby jsme neskončili nějakou takovouhle... Těžkým tématem. Tak co třeba ty a nějaký digitální detox? Já se na to ptám většinu našich hostů. Jak moc se od toho snažíš odpoutat a všechno povypínat? Nebo najít si nějaké místo, kde tě tvojí agenti nebudou otravovat? Hele, snažím se chodit hodně cvičit. Snažím se tři krát týdně být v posilovně a ještě běhat kolem toho doma. - A u toho vypnu? - Na nějakým stroji a tak. A u toho jako krásně vypnu. Pustím si prostě metaliku, nebo jako bootbooker je trošku tvrdší a zvedám činky, je mi dobře, jako že nepřemýšlím, jo. Ale pravda je taková, že jsem měl v pátek buknutý slot v posilovně a zrovna prostě na tu chvíli, kdy vycházel ten kvent Triosu, jo. Říkal jsem si, ty jo, nedalo se... - Já bych chtěl být radši u toho počítače, než jít do té posilovny. A posledně jsem říkal, ale moment, mně tady běží Herm Počkáš, až bude stažený, dáš ho tady do toho adresáře, pak si na mým disku najdeš skripty, kterýma se spouští podobné modely, přepíšš ty skripty, vytvoříš novej, pustíš to, jestli to nebude fungovat, upravý skript, podíváš se do logo toho servoru, co to serviruje. Až to budeš mít hotový, tak mi pošleš na Telegram zprávu, že to je hotový, že ten model běží. V půlce sešny, přišla zpráva na Telegram, tak ti jenom chci říct, že tady běží model, že jako v pohodě. Byl tam jako nakopaj ten kven nove Mě moc baví fotcení, už hrozně moc let. Hrozně ne na tvé úrovni, ale prostě rád fotím. - To bych úplně netvrdil. - To bych úplně netvrdil. - A tak jsi skvělý fotograf. A tak tam je to ten digitální detoxem z půlky, že jo? Protože přesně tak jsme se tam bavili, pak přijdeš k tomu počítačku, musíš vzírat do té obrazovky strašně dlouho a upravovat. No a hrozně moc baví jistavět drony, ty FPVčka, už jsem o tom mluvil, a lítat s těma FPVčkama. než jsem bůh jak dobrý pilot, ale zase nejsem úplně špatný pilot. Tady si strašně užívám to, že prostě vyjedu někam do hor, když nasadím si ty brýle a prostě pošlu ten dron 6 km od sebe na nějakou jinou horu, která tam je a pak si nám dvokilometrovej dive dolů a vidím to v těch brýlech, jak kdybych seděl na tom dronu. Je to prostě nádherný adrenalin, protože se může stát pousta věcí a tak. Kolik se jich nevrátilo už? Z těchto chvíletů se vrátili všechny drony zatím, ale v jadovnicích nad měry rybníka mám dva drony a dvě go oprah. Já zrovna jsem dneska vyplňoval reklamační formulář na dron, abych to poslal na opravu, protože mi tam ten gimbálek nějak zlobí. Zlobitě gimbálek. Tak s dronama je pořád legrace nějaká. A my občas natáčíme s kamarádem takový extrémní sporty a vědovnících si jezdí ten Hydro GP, udalosti mistrovství světa těch rychlých lodí. Tam jezdí lodě, které mají tisíc kubických centimetrů motory nebo dvanáct set a tak. To je prostě loďka, 160, 180 kilometrů po té vodě, po tom rybníku a ty za ně letíš s tím dronem, prostě jest to takhle celá voda a ty prostě se snažíš vyhnout a natáčíš a je to jako super. Tak tam třeba jedna lodně sejmula vyloženě průdem vody ten dron a skončil jsem na dně rybníka s tím GoPrem a druhá, tam mi došla baterka, jsem to přehnal prostě, zase jsem skončil na dně rybníka s druhým GoPrem rok potom. No takže tak, takže takový věci. Hezký, hezký. Už jsme tady měli všechno možné, jak ses přidal tady s dronama, to je takovou zálibu tady ještě, ještě nikdo nezmínil jako digitální detox, to je fajn. To je super, jako víš, jinak šefte ještě baví, on třeba kamošekry má jako v chorbatskou továrnu na lodě, on dělá malý rychlý speedbooty a třeba do luxusních jachet, máš velkou jachtu a potřebaš jako do boku speedboot, aby se mohl sednout v Monte Carlo a nedělal ostudu, když přijedeš a tak prostě každej rok tam zajedem a já se proletím za tou lodí, natočím nějaký záběry, prostě ta loď taky jako jede kilo, možná více, a ty zatím letíš jako s tím dronem a sedíš na té lodě a nebo prostě ten kapitán takhle jezdí do kolečka a ty furt sedíš na té lodě a teď on jezdí takhle do kolečka a ty voláš dron, který dělá něco úplně jiného, než cítí ten tvůj senzorický systém toho těla. Tak to je bomba, tam jsou super věci, co si člověk může zažít. Ještě byste pro naše posluchače mohl nastínit takovej úplnej začátek toho, když s tím někdo, s tím lokálním modelováním začít a má třeba už něco doma, třeba jaký herní počítač nebo si něco chce postavit, tak pár takovejch rad ještě na začátek, jestli bys pro ně měl. Jasně, určitě. Jestli máte doma počítač, který má grafickou kartu v sobě, která má aspoň 16 giga paměti, 24 je ideál, 32 je naprosto super, tak vemte jakýokoliv AI asistenta, který ho máte, a řekněte mu, chci si na svým počítači, který má 24 giga RAM, nebo 16 giga RAM, pustit model pomocí lama CPP, to je jeden z těch engineů, asi pro tohle to úplně nejlepší, to je takový jednoduchý engine, který se dá stáhnout ve dvou instalačkách, prostě neinstallat, jestli nějaký driver autů, řekni mi, co mám udělat a napíš mi příkaz na to, jak to spustím. A chtěl bych prostě model QAN 3.8, 27 miliard parametrů, nebo QAN 3.6, 35 miliard parametrů, nebo nějaký menší, podle to, když máte té paměti. 16 giga je na tohle to málo, takže tam jsou třeba nějaký 9 nebo 14 miliardový modely, zase jsou tam různé QANy, jsou tam ty GAMy, prostě. A řekni mi, kde tam mám stáhnout, Hug in Face, vygoogljete si Hug in Face, tam si vygoogljete ten model, napište tam QAN, napište tam GEMA, budete mít, anebo prostě řekněte tomu Cloudovi, nebo někomu, ať mám dal link na to stažení. Já si myslím, že tak do 3 čtvrtě hodiny máte doma rozjetý prostě model, nějakým endpointu, na který budete moct nasměrovat nějakého agenta, třeba Claude Code, nebo něco takového úplně jednoduše, zase se zeptejte toho svůj agenta, jak to máte udělat, nebo ať to udělá za vás. A za hodinu máte prostě svůj vlastní lokální model, který vám bude schopný kontrolovat počítače, který vám prostě pobíž a budu nám odpovídat a dělat věci. Dokáže to v takhle setupu udělat i websearch? Nebo na to potřebaš nějaké speciální věci? To je totiž věc, kterou já jsem třeba na těch mobilních věcech, který jsem zkoušel v telefonu, tam jsem vždycky narazil a byla to věc, která mě hrozně chyběla. Teď už jsem někde dobral toho, jak to udělat a jak to volat i na tom telefonu, ale v takhle základu. Model samotný ne, ten model prostě je model. Lama CPP, ten engine, o kterém jsem mluvil, tak ten má už i nějaké zabudované tooly, které umožňují spouštět terminál příkazy, číst soubory a dělat podobné věci, jako různé operace. A má MCPP, takže pokud, jako takhle, já to řeším tak, že mám něco, co se jmenuje Search XNG, což je prostě instalace, kterou si může když pustit do kru nebo nainstalovat prostě na počítač a to je jako lokální vyhledávací model, který má v sobě třeba 30 vyhledávačů, 30 Search Engineů a já si vyberu z toho, který chci, aby ten model používal. Většina z nich má nějaké množství dotazů zadarmo a ten model potom může prostě si nechat takový táhnout ty odpovědi. Když už použiješ agenta, jako třeba Hermes Edge, to je druhá věc, kterou bych mě strašně moc doporučit. Prostě zeptejte se svýho modulu, co to je Hermes Agent a jak je ho neinstalovat na Windows nebo na Linuxu, to je jedno, na Windows to běží krásně. To je něco jako Claude Code, nebo jako codex, nebo jako open code, ale má to i webový rozhraní, má to i desktopovou aplikaci, prostě má to i klasický TUI, v tom terminálu se to dá ovládat. A tam už jsou různé nástroje. Třeba je tam headless browser, browser, který nemá UI a který funguje normálně, že si pustí Google a hledá. A to, co tam nejde, tak vytáhne. Nebo pustí Carole, což je takový způsob, jak se ptat nějakýho, to prostě stáhnou data a stáhne ty data a zprocesuje. Takže dá se to udělat a tam trošička konfigurace, nemoc. Ten Hermes Agent to zvádne sám, udělá tady tohle všechno, ale ty ostatní už musíš malinko nakonfigurovat. To je taková věc, která mě tam hrozně scházela, že vlastně už nejsem zvyklý úplně bavit se jenom s tím jazykovým modelem jako takovým, ale že už prostě potřebuju tomu zadávat nějaký úkoly na webu, ať už, jak říkáš, aby to někde otevřelo stránku, někam kliklo, něco mě tam našlo, nebo hledalo prostě přes websearch, prostě nějaký podklady, který mě to zase zpracuje do nějakých researchů a jo. Já mám takhle jako nainstalovaný spoustu věcí, nějaké perplexity, tak já mám třeba variantu perplexity doma, která dokáže dělat jako výzkum, běžeme to doma v Dockeru, je to napojený, ten Search XNG, takže já tam prostě zadám nějakou věc a no to udělá doslova ten výzkum, porohadá to všechny ty zdroje, kam se dostane, kde to není robotama zablokovaný, tak stáhne prostě data a dá mi to a udělá mi nějaké summary, já se můžu doptávat a tak. Je spousta možností, jak to udělat, ale už to vyžaduje jako trošku nějaké konfigurace a práce a zase všechno to zvládnu, udělat ty modely. Řekneš tomu modelu, prostě já bych chtěl tady tohleto, tak on řekne, jo, jasně moment, stáhnu do krahu, stáhne do krahu, udělá to Co nějaká alternativa k Notebook LM od Google? To je taková ovlivná aplikace. Existuje, ale Notebook LM samozřejmě od Google je nejlepší, protože zase ty konektory na všechny ty modely, které ti zatím udělají ty videa, ty prezentace a tady tyhle, které jsou těžce specializované. Já si teďka nemyslel úplně, to je jich studio, který ti z toho dělá ty pokročilé věci, ale spíš nějaký systém, kde by si člověk udělal ten research. A ten model potom byl trošku víc zakotvený v těch datech, který si dohledá a odpovídá ti na základě nich, ať prostě se uživatelé vyhnou halucinacím, který asi u těchto lokálních modelů budou trošičku ty modely na to náchylnější než ty velký klaudový, kde mezi tím klaudovým modelem a uživatelem stojí zase nějaká aplikace, která trošičku se snaží, aby ty halucinace odstranila. - Obsidian je… - Ten samozřejmě mám. - Obsidian se můžeš nainstalovat i doma, vyložený obsidianovej server obsidianovou apku, a potom říct svýmu modelu, podívej se na Carpatyho LLM Wiki, Carpaty je jedna prostě s osobností, která teď definuje spoustu věcí v tom AI a vymýšlí spoustu použití pro různé věci, tak on myslel je tady to LLM Wiki, kdy prostě řekl pojďme v Obsidianu udělat jako nějaké tři složky, do jedné narvete hrubý data, cokoliv, prostě si od někud vyfotíte, stáhnete a takhle pdfka, obrázky, dáte to tam a do těch dalších dvou složek ten model prostě udělá víták, vícuc, strukturovaný text, všechno, co jako chceš a co ho poprosíš a potom vytváří postupně, tak mu dáváš ty věci, tak vytváří, dohledává, když chceš, další a další témata. Ještě ty věci, které už máš oloženy jako poznámky mezi sebou, propojuje, takže on dokáže udělat jako linky mezi tě to se známe s tím. A ještě je tam taková grafová nástavba, která to dokáže krásně vizualizovat. Takový trojnozněrnej prostě obrázek, kde je propojený ty jednotlivý tématy. Jo, to já mám polojený. No, no, no. A to je jako docela bomba, protože to fakt jako funguje úplně perfektně, kdy ty po tomto modelu třeba řekneš, ale najdi tam něco, doptej se, tady máš toto, jo, najdi na netu a porovnej to s tím a s tím. A ten model to udělá opravdu a ho víc jako ukotvíš v těch datech. A on s tím pracuje, jako s nějakou vektorovou databázi, nebo jede jenom v markdownech? Tohle jsou markdowny, myslím. Tohle není vektorová databáze. Já si totiž myslím, že Obsidian je celý jako markdownový. Je to tak, no. Že vlastně tak byl postavený ještě před příchodem L modelů a teďka nabil strašně jako na oblibě a užitečnosti, protože s těma markdownama hlavně cloud jako perfektně pracuje. Je to tak, no. Všechny ty modely to s nima umí jako super a tohleto se prostě nabízí. Zase je to jednoduché stáhnout, jednoduché reinstalovat. Ještě nějaké doporučení, co by začínající uživatel neměl minout? Já myslím, že už to stačí, že už jsme dneska nejdem na fouklý hlavu dost. Já bych o tom mohl mluvit strašně dlouho a... Šetři si něco na příště. No, asi jo, no. Jo, budu si šetřit na příště. Já určitě něco z toho musím vyzkoušet, i když tady můj pomalu stárnoucí MacBook Pro už se svýma 16 GB paměti toho, moc nezvládne, ale ono je to otázka. Já si myslím, že to je stroj, který před rokem, bych řekl, nezvládne nic a dneska s tou kvantizací a s novýma modelama si myslím, že naopak toho zvládne mnohem víc a víc a víc. A naprosto boží velikost jako na provozování těch malých vision modelů nebo modelů na zpracování textu. Takový ty OCR a tak to je to jako úplně super. No rozhodně musím vyzkoušet to třídějní fotek. Aha, to je jako zkus. Myslím, že mi překvapilo samotné hodně. To určitě vyzkouším, protože třeba mi to nějaký čas ušetří a třeba toho to donutím i, já bych totiž potřeboval, co bych potřeboval, potřeboval, aby když přijdu sfocení, aby on poznal, které věci jsou focené do různých verzií HDR, protože to fotím do tří fotek, do pětí fotek, fotím to tak, že mám ještě skládaný HDR do panoramy, některé věci jsou třeba z 15 fotek, aby se v tom jako zorientoval, vyznal a v Lightroomu, ale teď jsem jistý, jestli je MCPčko do Lightroomu. To asi nemá. Ale minimálně by mi to mohlo nějako předpřídit a ten Lightroom by to potom, protože Lightroom na to má nějakou utilitu, která jako za boha mně jako nefunguje správně. Tak. To máš úkol do příště. Dobře, dobře. Já se zamyslím, já se zamyslím. Já se mě bavilo to, že si říkal, že používáš cloud as Premiere a že prostě ti cloud jako něco stříhá a připravoje věci, tak já bych zase chtěl tohle to hrozně vyskoušet s tím svým lokálním dipsykem anebo s tím druhým modelem prostě. Ten MCP server v Premiere funguje jako skvěle a když tam nedojde k nějakému pomatení smyslu, jako nepoplete se tam něco v těch skillech, které to mám nastavený, tak teďka už jako to funguje reálně tak, že já si zesynchronizuju stopy tady z našeho podcastu, až odejdeš, hodím to cloudovi, řeknu mu, ať na to pustí to, co dělá s podcastem vždycky a výsledkem toho bude jako sestříhaný díl, bude z toho nachystaných jako 15 shortů s titulkama, s nějakou úvodní koncovou grafikou, bude tam nachystaný nějaký publikační plán na sociální sítě, který on nahraje do upload postu a prostě já si myslím, že za dvě hodiny nebude co řešit a bude takhle jako hezky připraveno. Super, to je naprosto perfektní použití a teď si představu, že to ještě zkombinuješ s tím, že ti to býží lokálně ten model a nemusí se to platit. Jo, to by bylo krásný, protože ten cloud není úplně levnej. Je to tak, ne? Ale zase na druhou stranu, tady jak to to MCP do premiéry jede přes nějaký skryptování, tak tamto tech tokenů to řekne se žere, to by bylo příjemné překvapení, že si myslím, že i lidi, co jedou třeba na 20 dolarovým předplatním, tak to můžou vyzkoušet a můžou na tom spoustu práce udělat maximálně. Zastaví to pětihodinový okno, takže to dodělají prostě v dalším. Ale že na to je to, jako není to žádný žerout tokenů. Já jsem si říkal, protože tam probíhají samozřejmě nějaký analýzy i jako obrazový, ale to dneska jako nic moc nesežere. No, já jsem dokonce na návno viděl takový hack, kdy někdo přišel na to, že když místo, aby poslal text tomu modelu, když udělá fotku, když udělá screenshot a pošel tu fotku, tak to stojí třeba desetkrát míň jako na tokeny, než když je dokonce. Já bym proč to screenshotuju. Takže to máš pravdu, tak může být. Hele, každopádně moc děkuji za rozhovor. Rád se s tobou potkám tady nad nějakýma dalšíma novinkama, až výjde zase nějaký nový Kimi nebo... Super model nebo super hardware. No, přesně tak. Tomu hardwareu bychom se mohli tak ještě pověnovat až zase zdražení. Takže kabely a ramky. Teď jsem viděl nějaký hezký mím na Facebooku Babišovi drahoty, kolik stojí ramka za Babiše a kolik za Fialy. Přesně tak. Je to hrozný, co ten Babiš dělá. A na celým světě. Víš, co mu to přihraje dalšímu kandidátovi ve volbách hlasů, až slíbí, že ramka bude... A ramka bude za původník 200 dolarů 32 giga. Takže díky, a já ještě připomenu divákům, že na našem webu, kde skončí zítřek, CZ mají různé slevy na AI akce a konference, takže mrkněte na to. Minimálně na Černá AI festival tam máte 20% slevu a ten festival se blíží. Už tam jsou poslední lístky k dispozici a pak tady máme ještě 20% slevu na AI video pro marketing a sociální sítě v Praze, takže mrkněte na to. Myslím si, že obět jakce budou stát za to a se s tebou o to víc. Tak jo, takže díky moc, těším se příště a se všima salvoučím. Paráda, díky za super povídání, Martina, za pozvání. Mějte se krásně. Mějte se. Titulky vytvořil Jirka Kováč

podcast o umělé inteligenciAI novinky českygenerativní AI českytechnologické novinky českytech podcast českybudoucnost technologiíautomatizace s AIKde skončí zítřekDeepSeekQwenlokální AI modelykvantizace modelůllama.cpp
Poslouchat na Substack ↗ Všechny epizody