Tech

Meta AI führt bahnbrechende mehrsprachige Spracherkennung ein

Meta AI stellt die Omnilingual ASR-Suite vor, die über 1.600 Sprachen unterstützt und eine bahnbrechende Open-Source-Lösung zur Spracherkennung bietet.

Einführung in die mehrsprachige Spracherkennung von Meta AI

Meta AI hat kürzlich die Omnilingual ASR-Suite vorgestellt, eine bahnbrechende Open-Source-Lösung zur mehrsprachigen Spracherkennung, die über 1.600 Sprachen umfasst. Diese Technologie verspricht, auch wenig dokumentierte Sprachen zu unterstützen, indem sie mit minimalem Aufwand auf weitere Sprachen erweitert werden kann. Die Modelle benötigen hierfür nur einige Sprachtextbeispiele und müssen nicht komplett neu trainiert werden, was einen großen Vorteil für die Sprachvielfalt darstellt Quellen: [Marktechpost, Meta Research].

Datenbasis und Modellarchitektur

Die Basis für die Sprachmodelle ist ein umfangreiches, supervisiertes Trainingsdatenset, das unter dem Namen AllASR bekannt ist. Es umfasst ca. 120.710 Stunden transkribierte Sprache, verteilt auf 1.690 Sprachen. Dieses umfangreiche Korpus kombiniert öffentliche Datensätze, interne und lizenzierte Korpora, sowie ein speziell für diese Initiative in Auftrag gegebenes Set, das Omnilingual ASR Korpus Quelle: [Meta Research].

Die Modelle der Omnilingual ASR-Suite basieren auf der wav2vec 2.0-Architektur mit selbstüberwachtem Lernen. Im Vergleich zum zehnfach größeren Datensatz, den Google für seine USM-Modelle verwendet, erreicht Meta mit einer effizienteren Nutzung der etwa 4,3 Millionen Stunden unlabeled Audio beeindruckende Ergebnisse Quelle: [Meta Research].

Modellfamilien und Leistungsfähigkeit

Die Omnilingual ASR-Suite umfasst drei Hauptmodellfamilien: CTC (Connectionist Temporal Classification), LLM (Large Language Model) ASR und die Self-supervised wav2vec 2.0-Encoder. Diese Modelle variieren in ihrer Größe und Leistungsfähigkeit enorm, wobei die Parameterzahlen von ca. 317 Millionen bis zu über 7 Milliarden reichen Quelle: [Marktechpost].

Ein besonderes Highlight ist die Zero-Shot-Spracherkennung, bei der das omniASR_LLM_7B_ZS-Modell in der Lage ist, neue Sprachen zu transkribieren, die es während des Trainings nicht gesehen hat. Dies wird durch kontextuelle Beispiele ermöglicht, die mit dem Modell kombiniert werden, um eine präzise Spracherkennung ohne zusätzliche Gewichtsanpassungen zu erzielen Quelle: [Meta Research].

Schlussfolgerung

Die umfassende Erfassung und Transkription von Sprachen, insbesondere von selten gesprochenen und bisher nicht erfassten, stellt einen bedeutenden Fortschritt in der Spracherkennungstechnologie dar. Durch den effektiven Einsatz von Ressourcen und das Angebot einer Open-Source-Lösung fördert Meta AI nicht nur die Weiterentwicklung der Technologie, sondern auch die sprachliche Vielfalt und den Zugang zu KI-basierten Sprachwerkzeugen weltweit.

Nathan Lewis
Recherchiert, geprüft und kompakt zusammengefasst — die wichtigsten KI-Entwicklungen der Woche, jeden Sonntag neu.

Weiterlesen

Alle Beiträge →
Newsletter

Sonntags klüger werden.

Jede Woche die wichtigsten News und Trends rund um künstliche Intelligenz — kompakt, verständlich und auf den Punkt.

Kostenlos · Kein Spam · Jederzeit abbestellbar