Tech

Meituans LongCat-Flash-Omni Modell: Fortschritte in Multi-Modalen KI

Das LongCat-Flash-Omni Modell von Meituan revolutioniert die Multi-Modale KI-Technologie mit innovativen Ansätzen und herausragenden Leistungen in Benchmarks.

Meituans LongCat-Flash-Omni Modell: Eine Revolution in der Multi-Modalen KI

Die Veröffentlichung des LongCat-Flash-Omni Modells von Meituan markiert einen bedeutenden Fortschritt in der Welt der Künstlichen Intelligenz-Technologie. Dieses open-source und omni-modale Modell verspricht, die Art und Weise, wie reale Interaktionen mit KI modalen Anwendungen umgesetzt werden, erheblich zu verändern.

Ein Überblick über die technischen Fähigkeiten

Das LongCat-Flash-Omni Modell ist mit beeindruckenden 560 Milliarden Parametern konzipiert, wobei etwa 27 Milliarden Parameter je Token aktiv sind. Dieser Ansatz basiert auf einem shortcut-verknüpften Mixture of Experts (MoE) Design, das erstmals im LongCat-Flash eingeführt wurde. Die Technologie erweitert das Text-Backbone auf Vision, Video und Audio und ermöglicht damit eine breite Palette von Multi-Modalen Anwendungen siehe Quelle 1.

Effizienz durch modale Entkopplung

Ein wesentliches Merkmal des LongCat-Flash-Omni Modells ist die modale Entkopplung der parallel ablaufenden Prozesse. Visuelle und auditive Encoder arbeiten mit einem Hybrid aus Sharding und Recomputing, während das Sprachmodell mit Pipeline-, Kontext- und Experten-Parallelität betrieben wird. Diese Architektur ermöglicht eine über 90-prozentige Beibehaltung der Durchsatzleistung im Vergleich zu rein textbasiertem Training siehe Quelle 1.

Leistungsbewertung und Benchmarks

Das LongCat-Flash-Omni Modell zeigt herausragende Leistungen in mehreren Benchmarks. Im OmniBench erreicht es einen Score von 61,4, was es über dem Qwen 3 Omni Instruct, jedoch noch unter dem Gemini 2.5 Pro positioniert. Auf dem VideoMME-Benchmark erzielt es einen nahen Spitzenwert von 78,2, und auf VoiceBench erreicht es 88,7, ein Wert, der leicht über GPT 4o Audio liegt siehe Quelle 1.

Fortschrittliche Trainingstechniken

Die Entwicklung des Modells umfasst ein gestaffeltes Schulungskonzept, das mit der Ausbildung des Text-Backbones beginnt und dann auf Text-Speech, multimodale Pretrainings mit Bild- und Videodaten bis zur 128K Kontextverlängerung und Audio-Encoder-Ausrichtung ausgeweitet wird. Diese sorgfältige Vorbereitungsstrategie trägt entscheidend zur Erreichung der hohen Leistungsfähigkeit des Modells bei siehe Quelle 1.

Integration und Real-Time Interaktion

Das LongCat-Flash-Omni Modell integriert einheitliche Bild- und Video-Codierung sowie eine kontinuierliche Audioverarbeitung. Durch die Verwendung von 2 Frames pro Sekunde als Standard-Videodaten-Sampling, das an die Dauerbedingungen angepasst wird, kann das Modell Audio- und visuelle Merkmale in Synchronisation dekodieren und ermöglicht so echte Real-Time Interaktionen siehe Quelle 1.

Mit LongCat-Flash-Omni setzt Meituan neue Standards in der Entwicklung von Multi-Modalen KI-Modellen, indem es durchdachte technische Innovationen und Strategien anwendet, die den Weg für praktische Anwendungen ebnen.

Nathan Lewis
Recherchiert, geprüft und kompakt zusammengefasst — die wichtigsten KI-Entwicklungen der Woche, jeden Sonntag neu.

Weiterlesen

Alle Beiträge →
Newsletter

Sonntags klüger werden.

Jede Woche die wichtigsten News und Trends rund um künstliche Intelligenz — kompakt, verständlich und auf den Punkt.

Kostenlos · Kein Spam · Jederzeit abbestellbar