Tech

Gelato-30B-A3B übertrifft GTA1-32B in GUI-Modellen

Gelato-30B-A3B zeigt überlegene Genauigkeit und Performance im Vergleich zu GTA1-32B für GUI-interaktive Aufgaben. Eine Analyse der Fortschritte in der Verankerung.

Vergleich der Benutzeroberflächen-Modelle: Gelato-30B-A3B und GTA1-32B

Einführung in Gelato-30B-A3B

Gelato-30B-A3B ist ein fortschrittliches Modell für die Verankerung von grafischen Benutzeroberflächen (GUI), das entwickelt wurde, um natürliche Sprachbefehle in präzise Klickpositionen umzuwandeln. Es basiert auf einer Mischung aus Expertenarchitekturen im Qwen3-VL-30B-A3B Instruct-Format und wird als modularer Verankerungskomponent in Agentenstapeln eingesetzt. Diese Trennung der Planung von der Verankerung ist besonders wichtig für Agenten, die in verschiedenen Betriebssystemen und Anwendungen mit unterschiedlichen Layouts operieren müssen. Das Modell verwendet das spezialisierte Click 100k Dataset als Grundlage, das nach Angaben von Marktechpost computergenerierte Bildschirmbilder mit natürlichen Sprachbefehlen und Anweisungen kombiniert.

Leistungsstärke von Gelato-30B-A3B

In Bezug auf die Genauigkeit übertrifft Gelato-30B-A3B das Modell GTA1-32B bei mehreren Benchmarks. Mit einer Genauigkeit von 63,88% auf ScreenSpot Pro und 69,15% auf OS-World-G, steigert es diese sogar auf 74,65% bei verfeinerten Benchmarks wie OS-World-G Refined. Eine Besonderheit von Gelato-30B-A3B liegt in der Fähigkeit, hohe Erfolgsraten in automatisierten Computeraufgaben, wie dem OS-World-Umfeld, zu erzielen. In einer Testreihe erreichte Gelato-30B-A3B eine automatische Erfolgsrate von 58,71%, während GTA1-32B bei 56,97% lag. Diese Ergebnisse verdeutlichen, dass eine verbesserte Verankerung direkt zu einer stärkeren Gesamtleistung eines Agenten führt Quelle: Marktechpost.

Trainingsansatz und Technische Details

Das Gelato-Modell profitiert von GRPO, einem verstärkenden Lernalgorithmus, der sich von Arbeiten über DeepSeekMath ableitet. Es verwendet sparsame Belohnungen, die nur dann ausgelöst werden, wenn der vorhergesagte Klick innerhalb des Zielbegrenzungsrahmens fällt, was die Genauigkeit der Verankerung im Vergleich zu rein überwachten Basismodellen erheblich steigert. Die Trainingseinheiten wurden auf 32 A100 GPUs durchgeführt, wobei der beste Checkpoint im Schritt 84 identifiziert wurde, was zeigt, dass hier die durchschnittliche Leistung über verschiedene Benchmarks hinweg maximiert wurde.

Vergleich mit GTA1-32B und Schlussfolgerungen

Im direkten Vergleich schlägt Gelato-30B-A3B das Modell GTA1-32B. Während GTA1-32B bei Bildklassifizierungsaufgaben solide Leistungen bietet, zeigen die Ergebnisse, dass Gelato-30B-A3B bei präzisen GUI-Interaktionen, die das Konvertieren von Sprachkommandos in Mausklickaktionen erfordern, überlegen ist. Diese Überlegenheit macht sich in Szenarien bemerkbar, in denen eine präzise Kombination aus visuellem Verstehen und Sprachverarbeitung entscheidend ist.

Zusammenfassend ist Gelato-30B-A3B ein bedeutender Fortschritt in der Verankerung von Benutzeroberflächen, indem es höhere Erfolgsquoten in komplexen interaktiven Umgebungen aufweist, die über das hinausgehen, was GTA1-32B erreichen kann. Dies zeigt, dass hochwertige Verankerungselemente entscheidend zur Funktionalität und Anpassungsfähigkeit moderner Computerverwendungs-Agenten beitragen können.

Nathan Lewis
Recherchiert, geprüft und kompakt zusammengefasst — die wichtigsten KI-Entwicklungen der Woche, jeden Sonntag neu.

Weiterlesen

Alle Beiträge →
Newsletter

Sonntags klüger werden.

Jede Woche die wichtigsten News und Trends rund um künstliche Intelligenz — kompakt, verständlich und auf den Punkt.

Kostenlos · Kein Spam · Jederzeit abbestellbar