Seamless M4T multimodalny model tłumaczeń od Meta

Celem stworzenia Seamless M4T jest ułatwienie tłumaczenia i transkrypcji mowy oraz tekstu. Wygląda na to, że zadanie się udało, ponieważ możliwości modelu sią niebywałe:

  • Automatyczne rozpoznawanie mowy dla prawie 100 języków.
  • Tłumaczenie mowy na tekst obsługuje 100 języków wejściowych i wyjściowych.
  • Tłumaczenie mowy na mowę dla prawie 100 języków wejściowych i 35 języków wyjściowych.
  • Tłumaczenie tekstu na tekst w prawie 100 językach
  • Tłumaczenie tekstu na mowę dla prawie 100 języków wejściowych i 35 języków wyjściowych.

Co ważniejsze model jest udostępniony na otwartej licencji CC BY-NC 4.0 więc każdy badacz lub programista będzie mógł go przetestować we własnym zakresie.

Co jest przewagą Seamless M4T? w przeciwieństwie, do systemów które powstały wcześniej nie jest on jak one ograniczony zasięgiem języka i nie polega na oddzielnych podsystemach, Seamless jest ujednoliconym modelem który może obsługiwać w kompleksowy sposób obsługiwać zadania tłumaczenia mowy na mowę i mowy na tekst.

Aby stworzyć ujednolicony model wielojęzyczny Meta oparła się na poprzednich innowacjach (No language Left Behind [NLLB] oraz Universal Speech Translator), dzięki temu Seamless może zrewolucjonizować komunikację między językami. Od siebie dodam, że marzenie o przyszłości, w której nie musimy uczyć się obcego z czasem może stać się rzeczywistością.

Aby stworzyć model, który będzie górował nad swoimi poprzednikami jego twórcy zastosowali różne techniki typu koderów tekstu i mowy, samo nadzorowane kodery oraz zaawansowane procesy dekodowania.

Tabela: high-level competitive landscape for the SeamlessM4T model

Małymi krokami zbliżamy się do tego co kiedyś wykraczało poza granice naszego zrozumienia, fikcja staje się prawdą, a to oznacza konieczność zapewnienia bezpieczeństwa systemu w taki sposób aby Seamless był modelem świadomym, ale nie niebezpiecznym.

Łączy nas coraz więcej, a globalna wioska, w której przyszło nam żyć stwarza nowe możliwości nie tylko dla nas, ale i sztucznej inteligencji, której osiągnięcia oraz przekraczanie barier (w tym przypadku językowych), staje się kamieniem milowym w kierunku międzyludzkiej komunikacji. Będziemy mogli postawić wieżę Babel, bo tym razem nikt nie pomiesza nam języków.

Wersja demonstracyjna SeamlessM4T można wypróbować pod linkiem: Seamless Communication Translation Demo (metademolab.com)

Kod, model i dane są do pobrania na GitHub: GitHub – facebookresearch/seamless_communication: Foundational Models for State-of-the-Art Speech and Text Translation

Źródło: Meta unveils SeamlessM4T multimodal translation model (artificialintelligence-news.com)