Nährwertangaben im Kleingedruckten, das Drehrad der Waschmaschine oder ein Ohrhörer unter dem Sofa stellen blinde und Menschen mit Sehbehinderungen im Alltag regelmäßig vor Hürden. Google hat dafür Guided Vision in Gemini Live gestartet. Die Funktion beschreibt per Kamera in Echtzeit, was vor dem Smartphone liegt, und steht auf Android-Geräten ab Android 9 bereit.
Gemini korrigiert Bildausschnitt
Grundlage ist die Kamerafreigabe in Gemini Live, die Google im vergangenen Jahr für alle Android-Nutzer kostenlos geöffnet hat. Mit aktiver Guided Vision gibt Gemini zusätzlich von sich aus Hinweise zum Bildausschnitt. Haltet ihr die Kamera zu hoch, zu nah oder seitlich daneben, bittet euch die KI, langsam nach rechts zu schwenken, das Gerät zu neigen oder einen Schritt zurückzutreten.
Laut Google hilft euch Gemini außerdem, verlorene Gegenstände zu finden, Kleidung farblich abzustimmen und euch in unbekannten Räumen zu orientieren. Ihr könnt dabei in mehreren Sprachen mit der KI sprechen.
SmartDroid.de bei Google folgenFür das Training arbeitete Google mit Aira zusammen, einem Dienst, bei dem geschulte Fachleute blinden Menschen per Video ihre Umgebung beschreiben. Laut Google flossen mehrere zehntausend Stunden solcher Beschreibungen ein, mehr als 1.000 Testerinnen und Tester aus Airas Netzwerk prüften das Modell im Alltag.
Fehler der KI bleiben unbemerkt
Google räumt selbst ein, dass Guided Vision wie jede generative KI Fehler machen kann. Die Funktion sei „kein Medizinprodukt, keine Mobilitätshilfe und kein Ersatz für den Blindenstock“ und eigne sich nicht für Navigation oder die Erkennung von Hindernissen. Wie oft das Modell Text falsch liest oder Gegenstände erfindet, sagt Google nicht.
Wie jede generative KI-Technologie ist auch „Guided Vision“ ein Hilfsmittel, das Fehler machen kann. Es handelt sich weder um ein Medizinprodukt noch um eine Mobilitätshilfe oder einen Ersatz für den Blindenstock, und es ist nicht für die Orientierung, die sichere Wegführung oder die Erkennung von Hindernissen vorgesehen. Nutzer sollten sich in der realen Umgebung weiterhin auf bewährte Mobilitätshilfen und sichere Verhaltensweisen verlassen.
Google (maschinell übersetzt)
Für die Zielgruppe wiegt das noch schwerer als bei anderen KI-Funktionen. Sehende merken meist, wenn ein Sprachmodell eine Zahl auf dem Etikett falsch wiedergibt. Blinde Menschen können die Antwort kaum gegenprüfen und müssen ihr vertrauen. Bei der Farbe eines Hemdes ist ein Fehler ärgerlich, bei Zutaten auf einer Verpackung oder der Stufe eines Herds kann er Folgen haben – und ausgerechnet Nährwertangaben und Geräteregler nennt Google als typische Einsatzzwecke.
Auf deutschsprachigen Geräten heißt Guided Vision übrigens etwas unhandlich „interaktive Orientierungshilfe“. Google verteilt die Funktion schrittweise, sie taucht also womöglich noch nicht bei allen auf. Ihr aktiviert sie in den Profileinstellungen der Gemini-App und teilt dann in Gemini Live die Kamera. Alternativ legt ihr in den Android-Einstellungen unter den Bedienungshilfen eine Verknüpfung an, etwa auf beide Lautstärketasten oder eine Wischgeste mit zwei Fingern. Mit TalkBack, das bereits Bildbeschreibungen per Gemini Nano erzeugt, ruft ihr die Funktion per Tipp mit drei Fingern aus dem Menü auf.
Ich halte die Hinweise zum Bildausschnitt für einen sinnvollen Ansatz, weil Kamera-KI oft schon daran scheitert, dass das Motiv gar nicht im Bild ist. Ob die Antworten verlässlich genug sind, lässt sich ohne Fehlerquoten nicht beurteilen, und Googles Hinweis schiebt die Verantwortung dafür zu euch. Gemini sollte deshalb offen sagen, wenn es sich unsicher ist, statt eine plausible Antwort zu formulieren. Offen bleibt auch, wie gut Guided Vision auf Deutsch funktioniert.
