Gemini Agent: Google Cloud setzt auf einen Assistenten

Gemini Agent: Google Cloud setzt auf einen Assistenten

Google Cloud will seine KI genau dort haben, wo Beschäftigte ohnehin arbeiten. Am 8. Oktober hat das Unternehmen Gemini Agent vorgestellt: einen einzigen Assistenten, der selbstständig handeln, Code schreiben und Aufgaben im Web, auf dem Smartphone und auf dem Desktop erledigen kann. Eine neue App brauchen Nutzer dafür nicht. Der Agent arbeitet über die Kommandozeile, in Google Workspace, Microsoft 365 und Slack und sogar in Anwendungen von Drittanbietern. Google beschreibt das Ziel als "allgegenwärtigen" Assistenten, der dem Nutzer folgt und nicht umgekehrt.

Ziele statt Anweisungen

Laut Google-Cloud-Chef Thomas Kurian kann Gemini Fragen beantworten, Wissensarbeit übernehmen, Bilder und Medien erzeugen und aus groben Ideen fertige Produkte machen. Er beschreibt den Wandel als neue Art, Arbeit abzugeben.

"Man gibt ihm Ziele, keine Anweisungen. Man delegiert ein Ergebnis und kommt zurück, wenn die Arbeit erledigt ist", sagte Kurian. "Damit ein Agent das kann, muss er mit den persönlichen Arbeitsabläufen, den maßgeblichen Datensystemen und den Kontrollmechanismen des Unternehmens verbunden sein."

Ein Gedächtnis, viele Kollegen

Das Produkt folgt einem Muster, das sich in der Branche inzwischen durchgesetzt hat: dauerhafte Ausführung. Gemini führt über alle Kanäle und alle von ihm gesteuerten Unteragenten hinweg einen gemeinsamen Bestand an Erinnerungen, Kontext und Personalisierung.

In der Praxis verhält sich der Agent wie ein Teamkollege, der sich merkt, was man ihm gesagt hat. Er kann außerdem kleinere Kollegen-Agenten abspalten, jeder mit eigener Identität, eigenem Fachgebiet, eigener E-Mail-Adresse unter @agents.company.com und eigenem dauerhaften Speicher. Diese Unteragenten sehen nur den Kontext, den der Nutzer oder sein Team freigibt.

Auch die Modellwahl gehört dazu. Jede Aufgabe läuft auf einem passenden Modell. Routinearbeit kann an Gemini Flash gehen, ein kleines und schnelles Modell, während langwierige Aufgaben ein Spitzenmodell wie Argon nutzen können. Die Claude-Modelle von Anthropic sind vom Start weg verfügbar, weitere proprietäre und offene Modelle sollen laut Google folgen.

Skills, Werkzeuge und Unternehmensdaten

Kurian betonte, dass der Agent den gesamten geschäftlichen Kontext eines Unternehmens verstehen soll, von Preisen und Produktportfolios bis dazu, wie einzelne Abteilungen arbeiten. Gemini stützt seine Antworten auf Unternehmensdaten und holt das Wissen der Organisation an die Oberfläche.

Die Liste der Anbindungen ist lang:

  • Zusammenarbeit: Confluence, Microsoft Office, Teams, Slack und Workspace
  • Entwicklerwerkzeuge: Git und Jira
  • Unternehmensplattformen: Salesforce und ServiceNow
  • Datenbanken: BigQuery, Databricks, Postgres und Snowflake
  • Lokale Dateien auf dem Desktop

Darauf setzen wiederverwendbare Skills auf: Bündel aus Anweisungen, Wissen und Arbeitsabläufen, die Agenten beibringen, bestimmte mehrstufige Aufgaben zu erledigen. Gemini bringt eine globale Bibliothek davon mit. Unternehmen können eigene Skills in einem gemeinsamen internen Verzeichnis veröffentlichen oder einen Agenten einfach bitten, eine gerade erledigte Aufgabe in eine wiederverwendbare Vorlage zu verwandeln.

Das System lernt zudem ständig dazu. Das Sitzungsgedächtnis kann tagelang laufen, während der Agent Dokumente liest, mit Menschen spricht und sich mit anderen Agenten abstimmt, und dabei aktualisiert er sein Bild davon, wie jeder Nutzer arbeitet und was er erwartet. Laut Google steckt der Agent so viel Aufwand in das Lernen über die Arbeit der Nutzer wie in den Aufruf von Werkzeugen.

Die ersten fachspezifischen Skills zielen auf Datenarbeit. Data Scientists und Data Engineers können ein gewünschtes Ergebnis in normaler Sprache beschreiben, und Gemini erzeugt PySpark-Code, stellt ein Notebook zum Bearbeiten und Testen bereit, trainiert ein Modell und behebt Probleme selbstständig. Für Fachanwender ermöglichen operative BigQuery-Berichtsskills und der Knowledge Catalog, dass der Agent auf Zuruf Abfragen erstellt und speichert. Ist ein Bericht einmal gespeichert, können Teams ihn ohne zusätzliche Token-Kosten erneut ausführen und erhalten jedes Mal einheitliche, geprüfte Antworten.

Ein Deckel für die Ausgaben

Die Kostenkontrolle bekommt beim Start ungewöhnlich viel Raum. Google weist darauf hin, dass die Preise pro Token seit 2024 um rund 98 % gefallen sind, das KI-Volumen in Unternehmen aber stark gewachsen ist, die Rechnungen also nicht unbedingt kleiner geworden sind.

Googles Antwort besteht aus mehreren Ebenen. Die im August angekündigten flexiblen Abrechnungsoptionen starten jetzt. Die Orchestrierung mehrerer Modelle teilt komplexe Aufgaben auf und schickt einfache Teile an schnelle Modelle, schwierige an Spitzenmodelle, während ein intelligentes Routing jede Arbeitslast dem Modell zuweist, das die beste Leistung zu den niedrigsten Kosten bietet.

Administratoren können außerdem in der Cloud Billing Console feste Ausgabenlimits setzen. Gemini verfolgt den Token-Verbrauch und pausiert, sobald eine Obergrenze erreicht ist. Weiter geht es erst, wenn jemand die Arbeit in der Konsole freigibt und akzeptiert, dass das Budget überschritten wird. Da die Erfassung pro Projekt erfolgt, können Unternehmen KI-Kosten einzelnen Abteilungen zuordnen und Budgets Team für Team planen.

Unsere Einschätzung

Gemini Agent ist weniger ein neues Modell als eine Wette auf die Platzierung: Google will die Ebene sein, die über allen Werkzeugen liegt, die ein Unternehmen bereits nutzt, auch denen von Microsoft. Damit tritt Google direkt gegen ähnliche Angebote anderer Unternehmensanbieter an, die sich ebenfalls als "Arbeitsebene" positionieren.

Zwei Details fallen auf. Unteragenten mit eigenen E-Mail-Adressen und eigenem Speicher lassen Agenten eher wie Personal als wie Software wirken, und das wirft praktische Fragen zu Berechtigungen und Aufsicht auf, die Unternehmen beantworten müssen. Und der starke Fokus auf Ausgabenobergrenzen deutet darauf hin, dass Kunden aus dem Ruder laufende Token-Rechnungen fürchten, eine Sorge, die sich auch in Coheres jüngsten Ausgabenlimits zeigt.

Es lohnt sich zu beobachten, ob das Versprechen "Ziele, keine Anweisungen" in unübersichtlichen echten Arbeitsabläufen hält und wie schnell die angekündigten Modelle anderer Anbieter tatsächlich kommen.