← Zpět na hlavní stránku

Anthropic Opus 4.6 a Agent Teams: Budoucnost AI automatizace

·9:28
Shrnutí epizody

Tato epizoda analyzuje revoluční vydání modelu Opus 4.6 od společnosti Anthropic, který zavádí funkci Agent Teams. Tato technologie umožňuje koordinaci specializovaných AI agentů, kteří samostatně řeší komplexní úkoly bez zásahu člověka. Tento podcast o umělé inteligenci zkoumá, jak Claude AI mění pravidla automatizace a co to znamená pro budoucnost práce v konkurenci s OpenAI.

Hlavní body

Přepis epizody

Zdravíme všechny posluchače podcastu Kde skončí zítřek. Jsme tu s vámi už po šedesáté šesté. Ahoj všem. Přesně tak, šedesátá šestá epizoda. To je něco, že? Čas letí a s AI ještě rychleji. To tedy ano. Sledujte nás v aplikaci, ve které nás posloucháte, aby vám už žádná novinka o AI neunikla.

Dnes se podíváme na žhavou novinku z dílny Anthropic, Claude Opus 4.6. Mám pocit, že tohle bude velká věc. Hlavně se zaměříme na jeho vylepšené schopnosti v kódování, agentní úkoly, to si vysvětlíme. A také na jeho výkon v různých benchmarcích, kde prý válcuje konkurenci. A také si povíme o jeho bezpečnosti, což je u takovýchto modelů klíčové. Bezpečnost je absolutní priorita. Mám trochu strach z těch agentních úkolů, aby nám to tu náhodou nezačalo řídit svět za zády. Ale pojďme na to. Jsem zvědavý.

Dobře, začněme tou největší novinkou, Claude Opus 4.6. Anthropic ho představil jako upgrade svého nejchytřejšího modelu a zdá se, že se chlubí právem. To jsem zvědav. Co konkrétně se zlepšilo? Především se chlubí, že má lepší kódovací schopnosti. Přesněji plánuje, udrží agentní úkoly déle, spolehlivě funguje ve větších kódových základech a lépe debuguje. Zkrátka, kódovací mág. Ale co ty agentní úkoly? To zní jako nějaká sci-fi záležitost. Aha, už chápu. Přesně tak. A Opus 4.6. To prý zvládá lépe, než kdy dřív. Může to mít obrovský dopad na automatizaci různých procesů. Třeba ve firmách. To zní slibně. Ale také trochu děsivě. Představa, že mi AI řídí celý den, mě moc neláká. Já bych nebyl tak skeptický. Představ si, že máš agenta, který ti automaticky vyřizuje administrativu, rešerše, nebo dokonce i plánuje schůzky. Ušetří ti to spoustu času a energie. Dobře. To zní lépe. A co dál? Co umí ještě Opus 4.6?

Dále je velkou novinkou jednomilionové tokenové kontextové okno v beta verzi. To je obrovské. Milion tokenů? Co to vlastně znamená? Vysvětli to prosím pro nás, kteří nejsme zrovna IT specialisté. Dobře. Zjednodušeně řečeno, kontextové okno určuje, kolik informací si model dokáže zapamatovat a použít z předchozí konverzace. Čím větší okno, tím lépe si pamatuje, o čem jste mluvili. A tím relevantnější a kontextuálnější jsou jeho odpovědi. Takže milion tokenů znamená, že si model dokáže zapamatovat obrovské množství informací? Přesně tak. Můžeš mu naservírovat dlouhý dokument, kód, nebo i celou knihu. A on si to bude pamatovat a používat při odpovídání na tvé otázky. Wow, to je opravdu hodně. To by se dalo využít třeba při psaní scénářů nebo knih, ne? Určitě. Můžeš ho použít jako brainstormovacího partnera, který si pamatuje celou zápletku a postavy. Nebo si ho můžeš nechat přečíst celou sérii knih a pak se ho zeptat na detaily, které si ty už nepamatuješ.

To zní úžasně, ale co ta praktická aplikace v reálném světě? Anthropic uvádí, že Opus 4.6 se dá využít pro finanční analýzy, výzkum, práci s dokumenty, tabulkami a prezentacemi. A dokonce i v Co-worku, kde může Claude pracovat autonomně. Co-work? Co to je? To je prý nějaká platforma, kde Claude může multitaskovat autonomně. To je jako nějaký pokus o digitálního asistenta, který ti pomáhá s prací. Takže já mu řeknu. Claude, udělej mi rešerši o konkurenci. A on si sám najde relevantní zdroje, přečte si je, zanalyzuje a pak mi to všechno shrne do přehledné prezentace? Přesně tak. Teoreticky. Uvidíme, jak to bude fungovat v praxi. Ale zní to hodně slibně.

A co ty benchmarky, o kterých jsi mluvil na začátku? Ano, tam prý Opus 4.6 válcuje konkurenci. Humanity's last exam? To zní jako nějaký sci-fi film. Ano, je to poměrně náročný test, který prověřuje znalosti z různých oborů. A Opus 4.6 ho prý zvládl nejlépe ze všech modelů. Tak to je opravdu působivé. A co ještě? Na GPQA, což je test zaměřený na ekonomicky hodnotné znalosti ve financích, právu a dalších oborech. Prý Opus 4.6 překonává GPT-4 od OpenAI o 144 ELO bodů. A svého předchůdce, Claude Opus 4.5 o 190 bodů. 144 ELO bodů? To je v podstatě jako kdyby šachový velmistr porazil mistra světa. Něco na tom bude. A také prý vede na Browskomp, což měří schopnost modelu najít těžkodostupné informace online. Takže je to takový digitální Sherlock Holmes?

A co bezpečnost? To je přece klíčové. Anthropic tvrdí, že Opus 4.6 má stejně dobrý nebo dokonce lepší bezpečnostní profil než ostatní modely. Prý vykazuje nízké míry nevhodného chování v bezpečnostních testech. To zní dobře. Ale já bych tomu úplně nevěřil. Vždycky se najde někdo, kdo to zkusí zneužít. To je pravda. Ale Anthropic si na bezpečnost dává hodně záležet. Testují to s externími experty a snaží se minimalizovat rizika. Doufejme, že se jim to podaří. Svět se mění rychle. A my potřebujeme, aby AI byla bezpečná a prospěšná pro všechny.

Přesně tak. A co se týče nových funkcí, tak v Claude Code teď můžeš sestavit týmy agentů, které pracují na úkolech společně. Týmy agentů? To zní jako Avengers, ale v digitálním světě. Něco na tom bude. Místo toho, aby jeden agent dělal všechno sám, tak se práce rozdělí mezi více agentů, kteří spolu koordinují. Takže já mu řeknu. Přesně tak. A prý to funguje rychleji a efektivněji, než když to dělá jeden agent sám. To zní opravdu dobře. To by se dalo využít v mnoha oblastech.

Adaptivní myšlení. To zní jako, že se model učí a přizpůsobuje se situaci. Ano, něco na tom bude. A také zavedli řízení úsilí, kde vývojáři mohou ovládat inteligenci, rychlost a cenu modelu. Takže si můžu nastavit, jestli chci, aby model byl velmi chytrý, ale pomalý a drahý, nebo jestli mi stačí, aby byl rychlý a levný, ale méně chytrý. Přesně tak. Mají zkrátka více možností, jak si model přizpůsobit svým potřebám. To zní opravdu dobře. To je hodně flexibility.

A také udělali vylepšení v Claude v Excelu a vydávají Claude v PowerPointu v Research Preview. Takže už můžu dělat prezentace s pomocí Claudea přímo v PowerPointu? Ano. Už to není tak, že ti Claude jen vygeneruje prezentaci, kterou si pak musíš stáhnout a upravit. Teď už to můžeš dělat přímo v PowerPointu s jeho pomocí. Super. To je velký krok vpřed. A co se týče ceny, tak ta zůstává stejná. To není zrovna levné. Ale zase, když ti to ušetří spoustu času a práce, tak se to může vyplatit. A navíc mají zachytávání promptů a dávkové zpracování, kde můžeš ušetřit až 90 % nákladů. Takže se to dá nějak optimalizovat. To je dobře.

A v neposlední řadě Opus 4.6 je prý nejlepší pro úkoly, které předtím žádný model neuměl a kde záleží na výkonu. Je prý vhodný pro softwarové inženýrství, agentní pracovní postupy a vysoce rizikové podnikové úkoly. To zní jako, že to je pro velké firmy, kde se hraje o hodně peněz. Ano, něco na tom bude. Ale i menší firmy a jednotlivci to mohou využít. Záleží na tom, co potřebuješ. Jsem zvědavý, jak se Opus 4.6 uchytí v praxi. Zní to hodně slibně, ale uvidíme, jak to bude fungovat v reálném světě. Já taky. Ale myslím si, že tohle je velký krok vpřed. AI se posouvá mílovými kroky. To je pravda. A my jsme tu, abychom vám o tom řekli. Kde skončí zítřek. Nové díly vycházejí každé pondělí, středu a pátek. Tak nás sledujte, ať vám nic neuteče. Podpořit a sledovat nás lze na Substacku, na všech sociálních sítích i na webu www.ipokusy.cz. Krátké upozornění. Tento podcast vzniká s pomocí umělé inteligence, která asistuje při přípravě obsahu i hlasové syntéze. Navzdory snaze o dokonalost může epizoda obsahovat drobné nepřesnosti.

Claude AIAI agenti automatizacepodcast o umělé inteligencigenerativní AI českytechnologické novinky českyprogramování s AIno-code AI nástrojebudoucnost technologií
Poslouchat na Substack ↗ Všechny epizody