Google-Test zeigt: KI programmiert funktionierende Android-Apps, aber scheitert an den letzten 20 Prozent

android-bench-vibecoding-generated-image-nano-banana-pro

Bild: Nano Banana Pro

Manche Apps verlieren beim Drehen ins Querformat alle Eingaben, andere spielen Videos weiter, obwohl sie längst aus dem Bild gescrollt sind – solche Fehler bleiben derzeit übrig, wenn KI-Modelle Android-Apps programmieren. Google hat seinen Programmiertest Android Bench zur Version 2.0 ausgebaut und listet diese Schwächen in der Auswertung auf. Die Modelle bekommen darin Aufgaben, für die Entwickler mehrere Tage bis eine Woche brauchen.

Das neuste und leistungsfähigste Modell von OpenAI, GPT-6 Astra, schließt 28 Prozent der Durchläufe fehlerfrei ab und führt damit. Google lässt jede Aufgabe fünfmal laufen. Bei den kleineren Aufgaben der ersten Version kamen die besten Modelle auf rund 91 Prozent.

Schon bei der letzten Neuauflage im Juli lag die Konkurrenz vor Googles Gemini, was irgendwie ein bisschen ironisch ist. Generell scheint Google im Wettlauf der Sprachmodelle ein wenig abgeschlagen, was sicherlich auch mit dem Zerfall des Forschungslabors DeepMind zusammenhängt. Zugutehalten muss man den Gemini-Modellen aber ihren Preis, denn die Kosten (und analog dazu die benötigte Rechenleistung) liegen im Schnitt weit unter denen der Rivalen.

SmartDroid.de bei Google folgen

Google misst jetzt auch, wie viel einer Aufgabe erledigt ist. Die Spitzenmodelle schaffen im Schnitt über 80 Prozent und treten dann auf der Stelle. GPT-5.6 Sol erreichte bei einer Umwandlung in Flutter nach 94 Schritten 84 Prozent. Weitere 121 Schritte brachten nur zwei Prozentpunkte mehr, Statistikseite und dunkles Design fehlten am Ende weiter. Fable 5.1 und Opus 5 bauten ein Nachrichten-Widget, das sich bei neuen Inhalten nicht aktualisiert.

Gut schneiden die Modelle bei gleichförmiger Fleißarbeit ab. Den Umstieg von Java auf die modernere und Android-spezifische Programmiersprache Kotlin in Signal wenden sie über Dutzende Dateien einheitlich an.

Die fast fertigen Apps starten, reagieren auf Eingaben und stürzen nicht ab. Ihre Schwächen fallen erst auf, wenn jemand das Gerät dreht, das dunkle Design einschaltet oder ein Widget auf dem Startbildschirm ablegt. Ich halte die neue Messung deshalb für aussagekräftiger als die alten Werte um 90 Prozent.

Generell ist KI aus der Softwareentwicklung nicht mehr wegzudenken, sowohl für Profis als auch für absolute Coding-Laien. Mein Kollege Denny hat erst neulich mit Google AI Studio in wenigen Minuten und ohne Vorwissen eine eigene App gebaut. Wer größere Projekte mit KI umsetzt, kommt um eine gründliche Prüfung des Codes aber weiter nicht herum.

SmartDroid.de als Quelle bei Google

Schreibe einen Kommentar

Bleibt bitte nett zueinander!