Sada nástrojů Gemini: vše, co dnes můžete dělat s aplikacemi, nástroji a API od Googlu pro umělou inteligenci

Poslední aktualizace: 25. března 2026
  • Sada nástrojů Gemini kombinuje stabilní nástroje jako Canvas, Deep Research a Guided Learning s experimentálními funkcemi Labs.
  • Rozhraní Gemini API odemyká multimodální a funkční pracovní postupy v rámci Google Workspace a vlastní automatizace.
  • Díky řízenému učení, Canvasu a agentům je Gemini osobním lektorem i pracovním asistentem pro dokumenty, prezentace a e-maily.
  • Díky integraci Labs, Gemini Enterprise a Workspace mohou týmy bezpečně testovat výkonnou umělou inteligenci na vlastních datech.

Koncept sady nástrojů Gemini

„Gemini toolbox“ už není jen chytlavé spojení; je to praktická sada aplikací, nástrojů, agentů a API, které Google tiše vplétá do všeho od běžného učení až po podnikové pracovní postupy. Místo jednoho monolitického asistenta se Gemini nyní chová spíše jako sada nástrojů, kde každá funkce představuje specifický nástroj: vyhledávač, tutor, pomocník s kódem, plánovač schůzek, nástroj pro tvorbu snímků a mnoho dalšího.

Pokud pochopíte, jak tyto prvky do sebe zapadají – Canvas, Guided Learning, Labs, agenti, Gemini Enterprise a Gemini API – můžete z Gemini udělat skutečného pracanta místo chatbota. Níže naleznete podrobnou prohlídku této sady nástrojů: co se nachází ve stabilní sekci „Nástroje“, co se testuje v sekci „Laboratoře“, jak se Gemini chová jako lektor s obrázky a videi a jak mohou vývojáři propojit API s Google Workspace pro seriózní automatizaci.

Co přesně je dnes v sadě nástrojů Gemini?

Gemini lze nejlépe chápat jako rodinu modelů umělé inteligence (Co jsou jazykové modely) (Gemini 1.0, Gemini 1.5, Gemini 3 atd.) dodávané prostřednictvím různých front-endů: web, mobilní aplikace, integrace Workspace a vývojářské API. Myšlenka „nástrojů“ vychází ze způsobu, jakým Google nyní seskupuje konkrétní funkce v rozhraní Gemini, zejména na webu.

Na webu je hlavní výběr v Gemini rozdělen do dvou hlavních zón: „Nástroje“ pro stabilní funkce připravené k provozu a „Laboratoře“ pro experimenty, které jsou stále ve vývoji. Představte si „Nářadí“ jako důvěryhodný šroubovák, který denně berete do ruky, zatímco „Laboratoře“ je přihrádka, kde uchováváte prototypy, které by mohly příští týden změnit tvar.

Na mobilních zařízeních aplikace Gemini přidávají mnoho stejných nástrojů – řízené učení, prostředí podobná Canvasu a nápovědu bohatou na obrázky – ale zavádějí se postupně. Pokud v aplikaci zatím nevidíte konkrétní funkci, Google výslovně doporučuje zkusit to znovu později nebo přejít na gemini.google.com zobrazit nejnovější verzi na webu.

V podstatě jsou všechny tyto povrchy podporovány rozhraním Gemini API, které zpřístupňuje multimodální modely a volání funkcí, takže můžete generovat obsah, analyzovat obrázky nebo organizovat pracovní postupy prostřednictvím kódu. Toto API je páteří pro mnoho automatizací Workspace, kterým se budeme věnovat později.

Nástroje a funkce Gemini

Nástroje vs. Laboratoře: jak Gemini organizuje své funkce

Vzhledem k tomu, že Gemini nashromáždilo více tlačítek a režimů, Google zavedl jasnější oddělení mezi vyspělými a experimentálními funkcemi prostřednictvím dvou sekcí: „Nástroje“ a „Laboratoře“. Tato změna je již viditelná na webovém rozhraní a postupně se zavádí ze serverů Google, takže ne každý účet vidí stejné rozvržení ve stejnou dobu.

V sekci „Nástroje“ Google ukládá funkce, které považuje za stabilní a předvídatelné pro každodenní použití. Zprávy ze zdrojů jako Android Police a 9to5Google ukazují, že tato oblast zahrnuje položky jako Deep Research, generování obrázků, tvorba videa prostřednictvím Veo, Canvas, Guided Learning a Deep Think, někdy vázané na specifické úrovně předplatného, ​​jako je Google AI Pro nebo Google AI Ultra.

„Laboratoře“ jsou naopak explicitní herní zóna: vyhrazená oblast uvnitř nástroje pro výběr Gemini, která seskupuje funkce označené jako experimentální. Obvykle uvidíte ikony s malou laboratorní baňkou a popisky jako Gemini Agent, Dynamické zobrazení (také nazývané vizuální rozvržení) a Osobní inteligence. Očekávání po kliknutí na cokoli v části Laboratoře je jednoduché: chování se může změnit, zmizet nebo posunout bez varování.

Z hlediska designu produktu je toto oddělení důležité pro důvěru. Když aplikace s umělou inteligencí rychle roste, riziko nespočívá jen v „přílišném množství funkcí“, ale v „nevím, na které funkce se mohu spolehnout“. Umístěním každodenních nástrojů do jedné zóny a experimentů do jiné signalizuje Gemini riziko podobným způsobem, jako když se v autě porovnává „normální“ a „sportovní“ režim.

Stabilní nástroje Gemini: Deep Research, Canvas, Guided Learning a další

Základní sada nástrojů Gemini pro většinu uživatelů se nachází v sekci „Nástroje“, kde najdete funkce, na jejichž základě si Google vytvoříte návyky. Přestože se přesná sestava liší podle účtu a úrovně předplatného, ​​několik prvků je již klíčových.

Deep Research transformuje Gemini na strukturovaného výzkumného asistenta, nikoli na generický model chatu. Když položíte otázku, která vyžaduje prozkoumání více zdrojů, Deep Research se řídí explicitnějším vícestupňovým procesem a představuje konzistentní metodologii, aby uživatelé věděli, co mohou očekávat pokaždé, když ji vyvolají.

Nástroje pro tvorbu obsahu pro obrázky a video – včetně integrací s podporou Veo – se nacházejí také v zásuvce Nástroje. Uživatelé, kteří se spoléhají na Gemini pro vizuální obsah, potřebují, aby tyto funkce byly snadno dohledatelné a přiměřeně stabilní, nikoli skryté za měnícími se experimentálními vlajkami.

Dalším pilířem je Canvas: režim pracovního prostoru, kde můžete spustit dokument nebo kódovací projekt přímo z výzvy a poté jej iterativně vylepšit pomocí Gemini. Pod panelem požadavků můžete vybrat „Plátno“ a zadat výzvu k vygenerování výchozího bodu pro obsah nebo kód a poté pokračovat v úpravách v interaktivním rozvržení vedle sebe.

Nástroje zaměřené na kognitivní rozvoj doplňují Guided Learning a Deep Think, zejména pro uživatele, kteří chtějí strukturovanou pomoc se složitými tématy. Řízené učení se může chovat jako lektor a krok za krokem vás provede jednotlivými myšlenkami, zatímco hluboké myšlení povzbuzuje k pomalejšímu a promyšlenějšímu uvažování o náročných otázkách.

Blíženci jako osobní lektor: Koordinované učení, obrázky a videa

Jedním z nejvíce uživatelsky přívětivých aspektů sady nástrojů Gemini je její schopnost fungovat jako soukromý učitel, který kombinuje řízené sekvence s vizuálními vysvětleními. Místo zahlcení textem může Gemini do svých odpovědí začlenit obrázky, náčrty a dokonce i videa, aby se koncepty snáze pochopily.

V praxi můžete požádat Blížence o vysvětlení tématu a výslovně požádat o schéma, vizuální rozbor nebo ilustrativní obrázek. Odpověď může tyto obrázky vložit přímo do vysvětlení, což vám pomůže vizualizovat například matematický koncept, pracovní postup nebo vědecký proces.

Podporováno je také učení založené na videu, ačkoli podrobnosti se liší podle regionu a fáze zavádění. U některých témat může Gemini zobrazit nebo odkázat na videa, která doplňují textovou odpověď, a vytvořit tak multimodální učební cestu, kde čtete, sledujete a interagujete s otázkami ve stejném sledu.

Tento režim výuky je v mobilních aplikacích Gemini zaváděn postupně, takže se vám nemusí všechny možnosti zobrazit hned. Když k tomu dojde, je záložní možností použití webového rozhraní, kde se funkce Gemini během postupného zavádění často objevují dříve.

Gemini Enterprise a Workspace: Agenti s umělou inteligencí pro týmy

Kromě osobního použití se sada nástrojů Gemini rozšiřuje i na pracoviště prostřednictvím integrací s Gemini Enterprise a Google Workspace. Zde se pozornost přesouvá z jednorázových výzev na trvalé agenty, pracovní postupy a spolupráci ve velkém měřítku.

Společnost Google popisuje Gemini Enterprise jako pokročilou platformu pro agenty, která přináší to nejlepší z umělé inteligence Googlu každému zaměstnanci a pracovnímu postupu. V praxi to umožňuje týmům objevovat, vytvářet, sdílet a spouštět agenty umělé inteligence v bezpečném prostředí, které je podpořeno jejich vlastními firemními daty, což snižuje úzká hrdla vývoje a umožňuje použití v případech, jako je analýza prodeje, automatizace procesů a interní vyhledávání znalostí.

Samotný Google Workspace funguje jako platforma pro spolupráci, kterou dále posiluje technologie Gemini, s umělou inteligencí zabudovanou do aplikací, jako jsou Gmail, Dokumenty a Meet. Místo přepínání na samostatný nástroj umělé inteligence si uživatelé mohou Gemini vyvolat přímo ve svých každodenních aplikacích pro produktivitu, aby mohli navrhovat obsah, shrnout informace nebo generovat nápady v kontextu.

V některých nastaveních můžete dokonce chatovat přímo s Gemini prostřednictvím podnikových dat uložených v Google Workspace, Microsoft 365 a dalších propojených systémech. Díky tomu se Gemini stává vrstvou znalostí v podniku, která dokáže odpovídat na otázky na základě e-mailů, dokumentů a souborů, a to v souladu s oprávněními a nastavením zabezpečení nakonfigurovaným IT oddělením.

Gemini API: páteř vývojářských nástrojů

Pod uživatelsky přívětivými aplikacemi Gemini se nachází rozhraní Gemini API, které vývojářům zpřístupňuje stejné základní modely, aby je mohli integrovat do svých vlastních aplikací. Toto API je místem, kde se multimodalita, volání funkcí a vlastní pracovní postupy spojují pro seriózní automatizaci, zejména s Google Workspace a Apps Script.

Modely Gemini jsou nejvýkonnější systémy umělé inteligence od Googlu a API nabízí různé varianty modelů – například verze zaměřené na text a verze orientované na vidění – každá se specifickými možnostmi a omezeními. Můžete si je vizuálně prohlédnout v Google AI Studiu, hostovaném rozhraní pro vyzkoušení výzev, úpravu nastavení modelu a dokonce i ladění vlastních modelů bez psaní kódu.

Chcete-li začít používat API, vyžádejte si klíč API prostřednictvím Google AI Studia nebo jiné podporované konzole a poté jej otestujte jednoduchým voláním REST. Například můžete exportovat svůj klíč do proměnné prostředí, jako je GOOGLE_API_KEY, a vyvolat koncový bod, který vypíše dostupné modely a přijme JSON, například modely/gemini-1.0-pro pokud je vše správně nakonfigurováno.

Odtud je generování obsahu otázkou odeslání datové části JSON do příslušného koncového bodu, jako je například generovat obsah metoda pro zvolený model. Minimální požadavek obsahuje obsah pole s textovými částmi, zatímco volitelné Konfigurace generace a Bezpečnostní nastavení umožňují vám ovládat parametry, jako je teplota a bezpečnostní filtry.

Volání rozhraní Gemini API z Apps Scriptu

Jedním z nejsilnějších vzorů v sadě nástrojů Gemini je kombinace API se skriptem Google Apps pro automatizaci pracovních postupů v rámci Workspace. Tento přístup vám umožňuje organizovat Gemini se službami jako Disk, Kalendář, Gmail, Tabulky a Prezentace, aniž byste museli budovat kompletní backend.

Standardní nastavení začíná projektem Apps Script (například vytvořeným pomocí script.new), kde uložíte klíč Gemini API jako vlastnost skriptu. V kódu načtete tuto hodnotu a vytvoříte URL koncového bodu pro konkrétní model, často gemini-1.0-pro-latest:generateContent s vaším klíčem API předaným jako parametr dotazu.

Pomocná funkce, jako např. callGemini(výzva, teplota) obvykle vytvoří datovou část JSON a odešle ji přes UrlFetchApp.fetch a analyzuje odpověď, aby extrahoval vygenerovaný text. Tento wrapper zjednodušuje opakované použití API z různých utilit ve vašem skriptu.

Testování je jednoduché: můžete vytvořit testGemini() Funkce, která definuje prompt, volá pomocnou funkci a zaznamenává vstup i výstup do protokolů provádění. Jakmile to bude fungovat, budete vědět, že vaše prostředí Apps Script a klíč Gemini API jsou správně zapojeny pro pokročilejší scénáře.

Použití koncového bodu Gemini Vision pro obrazy

Nástroje Gemini jdou nad rámec textu díky multimodální podpoře, zejména schopnosti zpracovávat obrázky prostřednictvím koncového bodu s podporou vidění. V Apps Scriptu se obvykle jedná o samostatný koncový bod, například gemini-1.0-pro-vision-latest:generateContent, opět parametrizovaný vaším API klíčem.

Typický pomocník, jako např. callGeminiProVision(výzva, obrázek, teplota) převede objekt blob do formátu base64 a vloží ho jako inlineData s příslušným typem MIME a odeslat jej spolu s textovou výzvou. Model poté vrátí text, který odráží jeho chápání obrázku i výzvy.

Pro ověření nastavení můžete napsat malý testGeminiVision() který stáhne vzorový obrázek z veřejné adresy URL, předá ho vašemu pomocníkovi a zaznamená zajímavý fakt nebo analýzu vytvořenou aplikací Gemini Vision. Tento typ testu prokazuje, že multimodální vstup ve vašem prostředí funguje správně.

Jakmile je tok vize stabilní, můžete jej znovu použít v rámci automatizací vyšší úrovně, jako je analýza grafů z Tabulek Google nebo obrázků uložených na Disku. A právě zde se multimodalita začíná jevit jako skutečně užitečná součást sady nástrojů, spíše než jako demonstrační trik.

Volání funkcí: poskytnutí přístupu k nástrojům pro Gemini

Dalším klíčovým prvkem sady nástrojů Gemini je volání funkcí, které umožňuje modelu rozhodnout se, kdy vyvolat vaše vlastní nástroje nebo API. Místo pouhého generování textu může Gemini vracet strukturované Volání funkce objekty, které popisují, kterou funkci použít a s jakými argumenty.

V Apps Scriptu si můžete nastavit pomocníka, například callGeminiWithTools(výzva, nástroje, teplota) který posílá nástroje specifikaci spolu s uživatelskou výzvou. Tato specifikace se řídí Deklarace funkce schéma, kde popíšete název funkce, její účel a parametry JSON.

Když se Gemini rozhodne, že by měl být použit nástroj, jeho odpověď obsahuje objekt volání funkce, který můžete ve svém skriptu analyzovat a nasměrovat k samotné implementaci. Můžete například definovat nástroj typu stub s názvem „datetime“, který vrací aktuální datum a čas, a sledovat, jak Gemini tuto funkci požaduje k řešení otázek souvisejících s výpočty v kalendáři.

Volání funkcí je obzvláště výkonné, protože může fungovat napříč více kroky, nejen u jednotlivých požadavků. To znamená, že můžete navrhovat složitější konverzační agenty, kteří rozhodují, kdy volat nástroje, interpretovat výsledky a pokračovat v dialogu.

Demo integrace: Gemini + Google Workspace jako praktický nástroj

Jakmile zkombinujete generování textu, vizuální vstup a volání funkcí, nástrojová sada Gemini se stane praktickým nástrojem pro automatizaci pracovních prostorů. Materiály společnosti Google Codelab nastiňují několik konkrétních příkladů, které ilustrují, co je možné.

Na vyšší úrovni jsou příchozí uživatelské dotazy předávány do Gemini pomocí sady dostupných nástrojů, které reprezentují různé pracovní postupy: plánování schůzek, tvorba e-mailů z grafů a vytváření prezentací. Na základě dotazu Gemini vybere správnou funkci a vrátí volání funkce se strukturovanými argumenty, jako jsou časy, názvy souborů nebo témata.

V Apps Scriptu pak interpretujete volání funkce uvnitř pokud…jinak řetězec, vyvolání příslušného pracovního postupu – například nastaveníMeeting(), návrhEmailu() or createDeck(). Tato kombinace modelového uvažování a explicitní logiky skriptu je to, co proměňuje Gemini z okna chatu v sadu nástrojů pro skutečnou práci.

Automatizace schůzek: shrnutí souborů z Disku do událostí Kalendáře

Jedna ukázka ukazuje, jak Gemini může pomoci s nastavením schůzky v Kalendáři, která automaticky zahrnuje shrnutí textového souboru hostovaného na Disku Google. Uživatel by mohl napsat něco jako: „Domluvte si schůzku s Helenou na zítřek v 10 hodin, abychom prodiskutovali novinky ze souboru Gemini-blog.txt.“

V zákulisí je ve specifikaci nástrojů deklarován nástroj pracovního prostoru s názvem „setupMeeting“ s parametry pro čas, příjemce a název souboru. Když Gemini interpretuje dotaz, vybere tento nástroj a vrátí volání funkce s vyplněnými argumenty.

Korespondence nastaveníMeeting() Funkce poté vyhledá zadaný soubor na Disku, přečte jeho obsah a předá jej Gemini prostřednictvím voláníGemini() s instrukcemi pro vytvoření krátkého JSON objektu obsahujícího název a stručné shrnutí. Odpověď se může vrátit zabalená v formátovacích ochranách, které před analýzou do formátu JSON odstraníte.

Pomocí extrahovaného názvu a shrnutí skript vytvoří událost Kalendáře pomocí Kalendářová aplikace, nastaví popis souhrnu a připojí zdrojový soubor prostřednictvím pokročilé služby Kalendář. Výsledkem je naplánovaná schůzka s kontextem, která je spuštěna jediným požadavkem v přirozeném jazyce.

Vytváření e-mailů z grafů v Tabulkách pomocí Gemini Vision

Dalším pracovním postupem v sadě nástrojů Gemini je analýza grafu v Tabulkách Google a na jeho základě vytvoření návrhu zprávy Gmail. Představte si, že si vedete tabulku s výdaji na vysokou školu a chcete e-mail, který shrnuje, co tabulka ukazuje pro kolegyni jménem Marie.

Uživatelský dotaz by mohl znít: „Napsat e-mail pro Marii s informacemi z grafu v listu Výdaje na vysokou školu.“ Nástroj s názvem „draftEmail“ je definován tak, aby přijímal název_sheetu a příjemce, a Gemini si tento nástroj vybere, když vidí tento typ požadavku.

Jedno návrhEmailu() Funkce vyhledá požadovanou tabulku na Disku, otevře příslušný list, načte jeho první graf a uloží jej jako soubor (například ExpenseChart.png). Poté sestaví výzvu, která Gemini instruuje, aby používal pouze informace z grafu, vyhýbal se historickým srovnáním a zachoval stručnost sdělení.

Zavoláním callGeminiProVision(výzva, graf výdajů)Skript odešle výzvu i obrázek grafu do Gemini Vision, která vrátí upravené tělo e-mailu. Nakonec skript vytvoří koncept v Gmailu adresovaný na e-mail příjemce, nastaví předmět, například „Výdaje na vysokou školu“, a připojí obrázek grafu.

Tento vzorec efektivně promění Blížence v analytika, který dokáže přečíst graf, extrahovat klíčový příběh a formulovat ho v přirozeném jazyce za vás. Stále kontrolujete a upravujete návrh, ale většina těžké práce se provádí automaticky.

Automatické vytváření balíčků slidů pomocí Gemini a Google Slides

Třetí hlavní demonstrační pracovní postup v této sadě nástrojů automaticky vytváří kostru prezentace v Google Slides na téma zadané uživatelem. Například se můžete zeptat: „Pomozte mi sestavit balíček o šetření vodou.“

Nástroj s názvem „createDeck“ je deklarován s jediným parametrem, topic, a Gemini je instruován, aby vrátil strukturovaný JSON popisující sérii slajdů. Výzva říká Gemini, kolik slidů má vytvořit (na základě konstanty, jako je NUM_SLIDES), požaduje krátké nadpisy a odrážky a explicitně požaduje platný objekt JSON, aby jej skript mohl bezpečně analyzovat.

Po zavolání voláníGemini() s touto výzvou skript odstraní všechny formátovací bariéry, analyzuje JSON a poté použije Aplikace Slides k vytvoření nové prezentace. První snímek je považován za titulní stránku a následující snímky mají rozvržení TITLE_AND_BODY, kde skript vyplní text nadpisu a odrážek.

Během několika sekund získáte základní balíček se strukturovanými body pro každý snímek, který si můžete vizuálně přizpůsobit. I když je výstup záměrně minimální, tento pracovní postup ukazuje, jak Gemini dokáže nastartovat strukturu obsahu, abyste se mohli soustředit na design a nuance.

Rozšiřování sady nástrojů: chatboti, RAG a víceotáčkové nástroje

Výše uvedené příklady jsou pouze výchozím bodem; širší sadu nástrojů Gemini lze rozšířit mnoha směry, jakmile se s API a voláním funkcí seznámíte. Google výslovně navrhuje několik možností, jak se vydat na průzkum.

Jedním z oblíbených případů použití je vytváření chatbotů pro Google Chat pomocí rozhraní Gemini API. Zde platí stejné vzorce: zpřístupníte nástroje, necháte Gemini rozhodnout se, kdy je zavolat, a propojíte odpovědi zpět do konverzačního rozhraní uvnitř Chatu, to vše řízeno Chat API a souvisejícími codelaby.

Dalším významným směrem je generování dat s rozšířeným vyhledáváním (RAG) nad rámec soukromého obsahu na Disku nebo v Keepu. Místo shrnutí jediného textového souboru můžete kombinovat Gemini API s vektorovou databází a volitelně s orchestračním frameworkem, jako je LangChain, abyste načetli relevantní úryvky z PDF, obrázků a poznámek a poté požádali Gemini o vygenerování odpovědi založené na těchto dokumentech.

Víceotáčkové volání funkcí také odemyká sofistikovanější agenty, kteří mohou iterativně rozhodovat, které nástroje použít a v jakém pořadí. Místo jediného rozhodnutí může agent zavolat funkci, prozkoumat výsledek a poté zavolat další funkci nebo položit upřesňující otázku, a to vše v rámci jednoho probíhajícího vlákna.

Konečně není nutné setrvávat uvnitř Workspace; jakmile zvládnete vzory Gemini API, můžete model propojit s externími API napříč širším webem. Takto se Gemini mění z uzavřeného firemního asistenta na univerzálního orchestrátora digitální práce.

Dohromady tyto prvky – stabilní nástroje, experimentální laboratoře, funkce doučování, podnikoví agenti a vývojářské API – tvoří skutečně bohatou sadu nástrojů Gemini, která se dokáže přizpůsobit jak příležitostným studentům, tak i pokročilým uživatelům. Pokud budete Gemini brát méně jako jednu aplikaci a spíše jako rostoucí sadu nástrojů, které můžete skládat, budete v silné pozici, abyste mohli využít výhod všeho, co Google příště přidá, aniž byste museli pokaždé přehodnocovat celý svůj pracovní postup.

Co jsou jazykové modely?
Související článek:
Co jsou jazykové modely a jak LLM skutečně fungují