ANZEIGE

ANZEIGE

Alibaba präsentiert neue KI-Modelle für Bild- und Audioverarbeitung

Illustriertes Logo von Alibabas Qwen
Foto: Alibaba

Key takeaways

Alibaba stellt neue multimodale KI-Modelle vor: Qwen-Image-3.0 und zwei neue Sprachmodelle ermöglichen komplexe Inhalte, natürliche Dialoge und hochwertige Sprachsynthese für Anwendungen in Medien, Bildung und Kundenservice.

Lesezeit ca. 2 Minuten

Der chinesische Technologie- und Handelskonzern Alibaba treibt die Entwicklung multimodaler Künstlicher Intelligenz weiter voran und stellt drei neue Modelle vor, die Bild- und Audioverarbeitung kombinieren. Die Systeme sind darauf ausgelegt, komplexe Inhalte zu verarbeiten, natürliche Dialoge zu führen und sich in reale Anwendungen wie Bildung, Unterhaltung oder Content-Produktion zu integrieren.

Neues Bildmodell für komplexe Inhalte

Mit Qwen-Image-3.0 präsentiert Alibaba ein weiterentwickeltes Modell zur Bildgenerierung, das besonders für anspruchsvolle Anwendungen konzipiert ist. Es unterstützt Eingaben von bis zu 4.500 Tokens und ermöglicht damit die Erstellung komplexer Inhalte wie Infografiken, Benutzeroberflächen oder Storyboards in einem einzigen Schritt.

Im Vergleich zum Vorgänger wurde die Kapazität zur Verarbeitung umfangreicher Texteingaben um das 4,5-Fache erhöht. Dadurch lassen sich detaillierte Anweisungen umsetzen, was insbesondere bei der Erstellung von Produktvisualisierungen, mehrsprachigen Marketingmaterialien oder filmischen Konzepten zu Effizienzgewinnen führt.

Anzeige

Gewinnen in der Plattform-Ökonomie

von Alexander Graf – der Leitfaden für Handelsentscheider
★★★★☆ 4,4 / 5 Sterne
Jetzt bei Amazon entdecken

Mehrsprachigkeit und komplexe Darstellungen

Das Modell unterstützt 12 Sprachen und über 20 Schriftarten und kann verschiedene visuelle Formate gleichzeitig darstellen. Dazu zählen Webseiten, Softwareoberflächen oder Chatfenster innerhalb eines einzigen Bildes. Die Fähigkeit, komplexe logische Zusammenhänge zu verstehen, ermöglicht eine präzisere Umsetzung verschachtelter Inhalte und reduziert den Aufwand für Nachbearbeitung.

Echtzeit-Sprachmodell für interaktive Anwendungen

Mit Qwen-Audio-3.0-Realtime stellt Alibaba ein Sprachmodell vor, das auf Echtzeitkommunikation ausgelegt ist. Es reagiert in Millisekunden, kann externe Tools und Datenquellen einbinden und unterstützt kontextbezogene Dialoge mit Gedächtnisfunktion.

Das Modell passt Tonlage, Emotion und Sprachstil dynamisch an und ermöglicht natürliche Gesprächsverläufe, inklusive Unterbrechungen und Hintergrundgeräuschen. Einsatzbereiche liegen unter anderem im Kundenservice, in der digitalen Bildung sowie in interaktiven Unterhaltungssystemen.

Text-to-Speech mit Studioqualität

Das zweite Audio-Modell, Qwen-Audio-3.0-TTS, fokussiert sich auf hochwertige Sprachsynthese. Es unterstützt 16 Sprachen sowie 20 chinesische Dialekte und erlaubt die Steuerung von Emotionen und Ausdrucksformen über spezielle Tags.

Mit einer Audioqualität von bis zu 48 kHz erfüllt das System professionelle Anforderungen, etwa für Filmvertonung oder Audioproduktionen. Die Plus-Version bietet dabei besonders hochwertige Ergebnisse, während eine Flash-Version für Echtzeitanwendungen optimiert ist.

Fokus auf reale Anwendungen und Effizienz

Mit den neuen Modellen erweitert Alibaba sein Portfolio für praxisnahe KI-Anwendungen. Die Kombination aus Bild- und Audioverarbeitung zielt darauf ab, Produktionsprozesse zu vereinfachen, Kosten zu senken und neue kreative Möglichkeiten zu erschließen – von interaktiven Lernformaten bis hin zu immersiven Medienerlebnissen.

Must-read

ANZEIGE
JANGER E-Commerce
Wer als Shop-Betreiber, E-Commerce Manager oder Gründer einer E-Commerce-Marke erfolgreich werden möchte, muss drei grundsätzliche Faktoren, Verkaufspsychologie, Außendarstellung und Design sowie Nutzererlebnis, verinnerlichen.

Top-News

Sponsored

Sponsored