Boîte à outils Gemini : tout ce que vous pouvez faire aujourd’hui avec les applications, les outils et l’API d’IA de Google

Dernière mise à jour: 25 mars 2026
Auteur: Andy Green
  • La boîte à outils de Gemini combine des outils stables comme Canvas, Deep Research et Guided Learning avec des fonctionnalités expérimentales de Labs.
  • L'API Gemini débloque des flux de travail multimodaux et d'appel de fonctions à travers Google Workspace et les automatisations personnalisées.
  • L'apprentissage guidé, Canvas et les agents font de Gemini à la fois un tuteur personnel et un assistant de travail pour les documents, les diapositives et les courriels.
  • L'intégration de Labs, Gemini Enterprise et Workspace permet aux équipes de tester en toute sécurité des IA puissantes sur leurs propres données.

Concept de boîte à outils Gemini

La « boîte à outils Gemini » n'est plus qu'un simple slogan ; c'est un ensemble concret d'applications, d'outils, d'agents et d'API que Google intègre discrètement à tous les contextes, de l'apprentissage informel aux processus métiers. Au lieu d'un assistant monolithique, Gemini fonctionne désormais comme une boîte à outils où chaque fonctionnalité est un instrument spécifique : moteur de recherche, tuteur, assistant de programmation, planificateur de réunions, créateur de présentations, et bien plus encore.

Si vous comprenez comment ces éléments s'articulent – ​​Canvas, l'apprentissage guidé, les Labs, les agents, Gemini Enterprise et l'API Gemini – vous pouvez transformer Gemini en un véritable outil de travail plutôt qu'en un simple chatbot. Vous trouverez ci-dessous une présentation détaillée de cette boîte à outils : les fonctionnalités stables de l'espace « Outils », les fonctionnalités en cours de test dans l'espace « Labs », le fonctionnement de Gemini comme tuteur avec images et vidéos, et la manière dont les développeurs peuvent intégrer l'API à Google Workspace pour une automatisation poussée.

Que contient exactement la boîte à outils Gemini aujourd'hui ?

Gemini s'apparente davantage à une famille de modèles d'IA ( comme les modèles de langage ) (Gemini 1.0, Gemini 1.5, Gemini 3, etc.) accessibles via différentes interfaces : web, applications mobiles, intégration à Workspace et API développeur. L'idée de « boîte à outils » provient de la manière dont Google regroupe désormais des fonctionnalités concrètes au sein de l'interface Gemini, notamment sur le web.

Sur le web, l'interface principale de Gemini est divisée en deux zones principales : « Outils » pour les fonctionnalités stables et prêtes pour la production, et « Laboratoires » pour les expérimentations en cours. Imaginez « Outils » comme le tournevis que vous utilisez quotidiennement, et « Laboratoires » comme le plateau où vous conservez les prototypes susceptibles d'évoluer.

Sur mobile, les applications Gemini intègrent progressivement bon nombre de ces outils (apprentissage guidé, expériences interactives de type Canvas, aide visuelle), mais leur déploiement est graduel. Si une fonctionnalité spécifique n'est pas encore disponible dans l'application, Google recommande de réessayer plus tard ou de consulter la version web la plus récente sur gemini.google.com .

En coulisses, toutes ces interfaces reposent sur l'API Gemini, qui expose des modèles multimodaux et des appels de fonctions permettant de générer du contenu, d'analyser des images ou d'orchestrer des flux de travail par le biais du code. Cette API constitue la base de nombreuses automatisations de l'espace de travail que nous aborderons plus loin.

Outils et fonctionnalités Gemini

Outils vs Laboratoires : comment Gemini organise ses fonctionnalités

Avec l'ajout de nouveaux boutons et modes à Gemini, Google a instauré une séparation plus claire entre les fonctionnalités matures et expérimentales grâce à deux sections : « Outils » et « Labs ». Ce changement est déjà visible sur l'interface web et est déployé progressivement depuis les serveurs de Google ; par conséquent, tous les comptes n'affichent pas la même interface simultanément.

La section « Outils » regroupe les fonctionnalités que Google juge stables et fiables pour une utilisation quotidienne. Selon des sources comme Android Police et 9to5Google, cette section inclut des éléments tels que la recherche approfondie, la génération d'images, la création vidéo via Veo, Canvas, l'apprentissage guidé et Deep Think, parfois liés à des abonnements spécifiques comme Google AI Pro ou Google AI Ultra.

« Labs », en revanche, est un espace d'expérimentation dédié : une zone spécifique du sélecteur Gemini regroupant les fonctionnalités expérimentales. Vous y trouverez généralement des icônes représentant un petit flacon de laboratoire et des intitulés tels que Gemini Agent, Vue dynamique (également appelée Disposition visuelle) et Intelligence personnelle. Lorsque vous cliquez sur un élément de « Labs », il faut vous attendre à quelque chose de simple : son comportement peut changer, disparaître ou se déplacer sans préavis.

Du point de vue de la conception produit, cette séparation est essentielle pour instaurer la confiance. Lorsqu'une application d'IA se développe rapidement, le risque ne réside pas seulement dans un « trop grand nombre de fonctionnalités », mais aussi dans l'incertitude quant à leur fiabilité. En plaçant les outils du quotidien dans une zone et les expérimentations dans une autre, Gemini signale le risque d'une manière similaire aux modes « normal » et « sport » d'une voiture.

Les outils stables de Gemini : Recherche approfondie, Canvas, Apprentissage guidé et plus encore

Pour la plupart des utilisateurs, l'essentiel de la boîte à outils Gemini se trouve dans l'onglet « Outils », où vous trouverez les expériences que Google souhaite vous aider à intégrer à votre quotidien. Bien que le contenu exact varie selon le compte et le niveau d'abonnement, certains éléments sont incontournables.

La fonctionnalité Recherche approfondie transforme Gemini en un assistant de recherche structuré, et non plus en une simple messagerie instantanée. Lorsqu'une question nécessite l'exploration de plusieurs sources, Recherche approfondie suit un processus en plusieurs étapes plus explicite, proposant une méthodologie cohérente pour que les utilisateurs sachent à quoi s'attendre à chaque utilisation.

Les outils de création de contenu pour les images et les vidéos, y compris les intégrations via Veo, se trouvent également dans le menu Outils. Les utilisateurs qui utilisent Gemini pour la création de contenu visuel ont besoin que ces fonctionnalités soient facilement accessibles et relativement stables, et non pas dissimulées derrière des options expérimentales fluctuantes.

Canvas est un autre élément essentiel : un mode d’espace de travail permettant de démarrer un document ou un projet de programmation directement depuis une invite, puis de l’affiner progressivement avec Gemini. Sous la barre de saisie, sélectionnez « Canvas » et saisissez votre invite pour générer un point de départ pour le contenu ou le code, puis poursuivez l’édition dans une interface interactive côte à côte.

L'apprentissage guidé et la réflexion approfondie complètent les outils axés sur la cognition, notamment pour les utilisateurs qui souhaitent une aide structurée sur des sujets complexes. L'apprentissage guidé peut servir de tuteur, en vous guidant pas à pas à travers les concepts, tandis que la réflexion approfondie encourage un raisonnement plus lent et plus réfléchi sur les questions difficiles.

Gemini comme tuteur personnel : apprentissage guidé, images et vidéos

L'un des atouts majeurs de la boîte à outils Gemini réside dans sa capacité à servir de tuteur privé, en combinant des séquences guidées et des explications visuelles. Plutôt que de noyer le lecteur sous un flot de texte, Gemini intègre des images, des schémas et même des vidéos à ses réponses pour faciliter la compréhension des concepts.

Concrètement, vous pouvez demander à Gemini d'expliquer un sujet et solliciter explicitement un schéma, une représentation visuelle ou une image illustrative. La réponse peut intégrer ces images directement dans l'explication, vous aidant ainsi à visualiser, par exemple, un concept mathématique, un flux de travail ou un processus scientifique.

L'apprentissage par la vidéo est également pris en charge, bien que les modalités varient selon la région et la phase de déploiement. Pour certains sujets, Gemini peut proposer ou référencer des vidéos qui complètent sa réponse textuelle, créant ainsi un parcours d'apprentissage plus multimodal où vous lisez, regardez et interagissez avec les questions de manière fluide.

Ce mode d'apprentissage est déployé progressivement dans les applications mobiles Gemini ; il est donc possible que certaines options ne soient pas immédiatement disponibles. Dans ce cas, vous pouvez utiliser la version web, où les fonctionnalités de Gemini sont souvent accessibles plus tôt lors des déploiements progressifs.

Gemini Enterprise et Workspace : des agents d’IA pour les équipes

Au-delà de l'usage personnel, la suite Gemini s'étend au monde de l'entreprise grâce aux intégrations avec Gemini Enterprise et Google Workspace. L'accent est alors mis non plus sur les notifications ponctuelles, mais sur des agents persistants, des flux de travail et une collaboration à grande échelle.

Gemini Enterprise est décrite par Google comme une plateforme d'agents avancée qui met le meilleur de l'IA de Google à la disposition de chaque employé et pour chaque flux de travail. Concrètement, elle permet aux équipes de découvrir, créer, partager et exécuter des agents IA dans un environnement sécurisé, s'appuyant sur les données de leur propre entreprise. Ceci réduit les obstacles au développement et permet des cas d'usage tels que l'analyse des ventes, l'automatisation des processus et la recherche de connaissances internes.

Google Workspace est une plateforme de collaboration optimisée par Gemini, intégrant l'IA à des applications comme Gmail, Docs et Meet. Au lieu d'utiliser un outil d'IA externe, les utilisateurs peuvent faire appel à Gemini directement depuis leurs applications de productivité habituelles pour rédiger du contenu, synthétiser des informations ou générer des idées en contexte.

Dans certaines configurations, vous pouvez même dialoguer directement avec Gemini via vos données d'entreprise stockées sur Google Workspace, Microsoft 365 et d'autres systèmes connectés. Gemini devient ainsi une plateforme de connaissances d'entreprise capable de répondre aux questions à partir des e-mails, documents et fichiers, sous réserve des autorisations et des paramètres de sécurité définis par le service informatique.

L'API Gemini : la base de la boîte à outils du développeur

Sous l'interface utilisateur des applications Gemini se cache l'API Gemini, qui expose les mêmes modèles de base permettant aux développeurs de les intégrer à leurs propres applications. Cette API permet de combiner la multimodalité, les appels de fonctions et les flux de travail personnalisés pour une automatisation poussée, notamment avec Google Workspace et Apps Script.

Les modèles Gemini sont les systèmes d'IA les plus puissants de Google, et leur API propose différentes variantes (axées sur le texte ou la vision, par exemple), chacune avec ses propres capacités et limites. Vous pouvez les explorer visuellement dans Google AI Studio, une interface hébergée permettant de tester des suggestions, de modifier les paramètres des modèles et même de personnaliser des modèles sans écrire une seule ligne de code.

Pour commencer à utiliser l'API, demandez une clé API via Google AI Studio ou une autre console compatible, puis testez-la avec un simple appel REST. Par exemple, vous pouvez exporter votre clé dans une variable d'environnement comme GOOGLE_API_KEY et appeler le point de terminaison qui liste les modèles disponibles. Vous recevrez alors un JSON tel que models/gemini-1.0-pro si tout est correctement configuré.

À partir de là, la génération de contenu consiste à envoyer une requête POST JSON au point de terminaison approprié, tel que la méthode `generateContent` pour un modèle choisi. Une requête minimale comprend un champ `contents` avec des éléments textuels, tandis que les champs optionnels `generationConfig` et `safetySettings` permettent de contrôler des paramètres comme la température et les filtres de sécurité.

Appel de l'API Gemini depuis Apps Script

L'un des atouts majeurs de Gemini réside dans l'association de son API à Google Apps Script pour automatiser les flux de travail au sein de Workspace. Cette approche permet d'orchestrer Gemini avec des services tels que Drive, Agenda, Gmail, Sheets et Slides sans avoir à développer une infrastructure complète.

La configuration standard commence par un projet Apps Script (par exemple, créé via script.new) où vous stockez votre clé API Gemini en tant que propriété de script. Dans le code, vous récupérez cette valeur et construisez une URL de point de terminaison pour un modèle spécifique, souvent gemini-1.0-pro-latest:generateContent , en passant votre clé API comme paramètre de requête.

Une fonction auxiliaire telle que `callGemini(prompt, temperature)` construit généralement une charge utile JSON, l'envoie via `UrlFetchApp.fetch` et analyse la réponse pour en extraire le texte généré. Ce wrapper simplifie la réutilisation de l'API depuis différents utilitaires de votre script.

Les tests sont simples : il suffit de créer une fonction `testGemini()` qui définit une invite, appelle votre fonction d'assistance et consigne les entrées et sorties dans les journaux d'exécution. Une fois le test concluant, vous savez que votre environnement Apps Script et votre clé API Gemini sont correctement configurés pour des scénarios plus complexes.

Utilisation du point de terminaison Gemini Vision pour les images

La boîte à outils Gemini va au-delà du simple traitement de texte grâce à la prise en charge multimodale, notamment la possibilité de traiter des images via un point de terminaison compatible avec la vision. Dans Apps Script, il s'agit généralement d'un point de terminaison distinct, tel que gemini-1.0-pro-vision-latest:generateContent , paramétré par votre clé API.

Une fonction d'assistance classique comme `callGeminiProVision(prompt, image, temperature) ` convertit une image en base64, l'intègre comme donnée en ligne avec le type MIME approprié et l'envoie avec une invite textuelle. Le modèle renvoie ensuite un texte reflétant sa compréhension de l'image et de l'invite.

Pour vérifier la configuration, vous pouvez écrire une petite fonction `testGeminiVision()` qui télécharge une image d'exemple depuis une URL publique, la transmet à votre fonction d'assistance et consigne une information ou une analyse produite par Gemini Vision. Ce type de test démontre que la saisie multimodale fonctionne correctement dans votre environnement.

Une fois le flux visuel stabilisé, vous pouvez le réutiliser dans des automatisations de niveau supérieur, comme l'analyse de graphiques Google Sheets ou d'images stockées dans Drive. C'est là que la multimodalité devient un outil véritablement utile, et non plus un simple artifice de démonstration.

Appel de fonctions : donner à Gemini accès aux outils

Un autre élément clé de la boîte à outils Gemini est l'appel de fonctions, qui permet au modèle de déterminer quand invoquer vos propres outils ou API. Au lieu de simplement générer du texte, Gemini peut renvoyer des objets `functionCall` structurés qui décrivent la fonction à utiliser et ses arguments.

Dans Apps Script, vous pouvez configurer une fonction d'assistance telle que ` callGeminiWithTools(prompt, tools, temperature)` qui envoie une spécification d'outils avec l'invite utilisateur. Cette spécification suit un schéma de déclaration de fonction , où vous décrivez le nom de la fonction, son objectif et ses paramètres JSON.

Lorsque Gemini détermine qu'un outil doit être utilisé, sa réponse inclut un objet d'appel de fonction que vous pouvez analyser dans votre script et rediriger vers l'implémentation réelle. Vous pouvez, par exemple, définir un outil factice nommé « datetime » qui renvoie la date et l'heure actuelles, et observer comment Gemini utilise cette fonction pour résoudre des problèmes liés aux calculs de calendrier.

L'appel de fonctions est particulièrement puissant car il peut s'effectuer sur plusieurs tours de parole, et non pas seulement par requêtes ponctuelles. Cela permet de concevoir des agents conversationnels plus complexes, capables de décider quand appeler des outils, d'interpréter les résultats et de poursuivre le dialogue.

Intégrations de démonstration : Gemini + Google Workspace comme boîte à outils pratique

Une fois la génération de texte, la saisie visuelle et l'appel de fonctions combinées, la boîte à outils Gemini devient un moteur pratique pour l'automatisation des espaces de travail. Les ressources de l'atelier de programmation de Google présentent plusieurs exemples concrets illustrant les possibilités offertes.

De manière générale, les requêtes des utilisateurs sont transmises à Gemini avec un ensemble d'outils disponibles représentant différents flux de travail : planification de réunions, rédaction d'e-mails à partir de graphiques et création de présentations. En fonction de la requête, Gemini sélectionne la fonction appropriée et renvoie un appel de fonction avec des arguments structurés tels que les dates, les noms de fichiers ou les sujets.

Dans votre script Apps Script, vous interprétez ensuite l'appel de fonction au sein d'une chaîne if…else , en déclenchant le flux de travail approprié – par exemple, setupMeeting() , draftEmail() ou createDeck() . Cette combinaison de raisonnement basé sur un modèle et de logique de script explicite transforme Gemini, d'une simple fenêtre de discussion, en une véritable boîte à outils pour le travail.

Automatisation des réunions : synthèse des fichiers Drive en événements de calendrier

Une démonstration montre comment Gemini peut faciliter la création d'une réunion dans l'agenda incluant automatiquement un résumé d'un fichier texte hébergé sur Google Drive. L'utilisateur pourrait par exemple saisir : « Planifier une réunion demain à 10 h avec Hélène pour discuter des actualités contenues dans le fichier Gemini-blog.txt. »

En coulisses, un outil Workspace nommé « setupMeeting » est déclaré dans la spécification des outils, avec des paramètres pour l’heure, le destinataire et le nom du fichier. Lorsque Gemini interprète la requête, il sélectionne cet outil et renvoie un appel de fonction avec ces arguments renseignés.

La fonction setupMeeting() correspondante localise ensuite le fichier spécifié dans Drive, lit son contenu et le transmet à Gemini via callGemini() avec des instructions pour générer un court objet JSON contenant un titre et un bref résumé. La réponse peut être encapsulée dans des balises de formatage que vous devez supprimer avant de l'analyser au format JSON.

À partir du titre et du résumé extraits, le script crée un événement dans CalendarApp , définit la description à partir du résumé et joint le fichier source via le service Calendar avancé. Il en résulte une réunion planifiée avec son contexte intégré, déclenchée par une simple requête en langage naturel.

Rédiger des e-mails à partir de graphiques Sheets avec Gemini Vision

Une autre fonctionnalité de Gemini consiste à analyser un graphique dans Google Sheets et à rédiger un message Gmail à partir de celui-ci. Imaginez que vous tenez un tableau récapitulatif des dépenses universitaires et que vous souhaitiez envoyer un e-mail à une collègue nommée Marie, qui résume les informations contenues dans ce graphique.

La requête de l'utilisateur pourrait être : « Rédigez un e-mail pour Mary contenant des informations tirées du graphique de la feuille CollegeExpenses. » Un outil appelé « draftEmail » est défini pour accepter un nom de feuille et un destinataire, et Gemini choisit cet outil lorsqu'il détecte ce type de requête.

La fonction draftEmail() localise la feuille de calcul demandée dans Drive, l'ouvre, récupère son premier graphique et l'enregistre dans un fichier (par exemple, ExpenseChart.png). Elle génère ensuite une invite demandant à Gemini d'utiliser uniquement les informations du graphique, d'éviter les comparaisons historiques et de rédiger un message concis.

En appelant la fonction `callGeminiProVision(prompt, expenseChart)` , le script envoie à Gemini Vision l'invite et l'image du graphique, qui renvoie un corps d'e-mail personnalisé. Enfin, le script crée un brouillon Gmail adressé à l'adresse e-mail du destinataire, définit un objet tel que « Frais d'études » et y joint l'image du graphique.

Ce modèle transforme Gemini en un analyste capable d'interpréter un graphique, d'en extraire les informations clés et de les formuler en langage naturel pour vous. Vous pouvez toujours relire et ajuster le brouillon, mais l'essentiel du travail est automatisé.

Création automatique de présentations avec Gemini et Google Slides

Le troisième flux de travail de démonstration principal de cette boîte à outils génère automatiquement une présentation Google Slides de base sur un sujet spécifié par l'utilisateur. Par exemple, vous pourriez demander : « Aidez-moi à créer une présentation sur la conservation de l'eau. »

Un outil nommé « createDeck » est déclaré avec un seul paramètre, « topic », et Gemini est configuré pour renvoyer un JSON structuré décrivant une série de diapositives. L’invite indique à Gemini le nombre de diapositives à créer (en fonction d’une constante telle que NUM_SLIDES), demande des titres courts et des puces, et exige explicitement un objet JSON valide afin que le script puisse l’analyser sans problème.

Après avoir appelé la fonction callGemini() avec cette invite, le script supprime les barrières de formatage, analyse le JSON puis utilise SlidesApp pour générer une nouvelle présentation. La première diapositive sert de page de titre, et les diapositives suivantes suivent une mise en page TITRE_ET_CORPS où le script insère automatiquement le titre et les puces.

En quelques secondes, vous obtenez une présentation de base avec des points clés structurés pour chaque diapositive, prête à être personnalisée visuellement. Bien que le résultat soit volontairement minimaliste, ce flux de travail illustre comment Gemini peut accélérer la structuration du contenu afin que vous puissiez vous concentrer sur le design et les subtilités.

Élargir la boîte à outils : chatbots, RAG et outils multi-tours

Les exemples ci-dessus ne sont qu'un point de départ ; la boîte à outils Gemini, plus complète, offre de nombreuses possibilités une fois que vous maîtrisez l'API et les appels de fonctions. Google suggère d'ailleurs plusieurs pistes à explorer.

Un cas d'utilisation courant consiste à créer des chatbots pour Google Chat à l'aide de l'API Gemini. Le principe reste le même : vous exposez des outils, Gemini décide quand les appeler et intègre les réponses dans une interface conversationnelle au sein de Chat, le tout étant géré par l'API Chat et les ateliers de programmation associés.

Une autre piste importante consiste à utiliser la génération augmentée par récupération (RAG) à partir de contenu privé stocké sur Drive ou Keep. Au lieu de résumer un simple fichier texte, vous pouvez combiner l'API Gemini avec une base de données vectorielle et, éventuellement, un framework d'orchestration comme LangChain pour extraire des extraits pertinents de PDF, d'images et de notes avant de demander à Gemini de générer une réponse basée sur ces documents.

L'appel de fonctions en plusieurs étapes permet également de déployer des agents plus sophistiqués, capables de décider itérativement des outils à utiliser et de leur ordre d'exécution. Au lieu d'une décision unique, un agent peut appeler une fonction, examiner le résultat, puis appeler une autre fonction ou poser une question de clarification, le tout au sein d'un même flux de travail.

Enfin, il n'est pas nécessaire de rester dans Workspace ; une fois les modèles de l'API Gemini maîtrisés, vous pouvez connecter le modèle à des API externes sur l'ensemble du web. C'est ainsi que Gemini passe d'un assistant d'entreprise intégré à un orchestrateur de travail numérique polyvalent.

Ensemble, ces éléments – outils stables, laboratoires expérimentaux, fonctionnalités de tutorat, agents d'entreprise et API développeur – forment une boîte à outils Gemini d'une grande richesse, adaptable aussi bien aux apprenants occasionnels qu'aux utilisateurs experts. Envisagez Gemini non pas comme une application unique, mais comme un ensemble d'instruments évolutifs que vous pouvez combiner. Vous serez ainsi parfaitement préparé à tirer parti des futures fonctionnalités ajoutées par Google sans avoir à repenser entièrement votre flux de travail à chaque fois.

Que sont les modèles de langage ?
Article connexe:
Que sont les modèles de langage et comment fonctionnent-ils réellement ?