Google uruchomił w serwisie Flow Music model Lyria 3.5, który generuje bardziej naturalne wokale i teksty piosenek, podczas gdy konkurencyjne Suno i Udio wciąż zmagają się z pozwami wytwórni muzycznych.
Platformy streamingowe toną w syntetycznych utworach generowanych przez boty, a Google właśnie odkręca kurek z cyfrową, muzyczną pulpą na pełną szerokość. Do aplikacji Gemini trafił najbardziej zaawansowany model muzyczny giganta – Lyria 3.5. Jednocz...
Gigant technologiczny oficjalnie wytacza najcięższe działa w walce o dominację nad sztuczną inteligencją generującą dźwięk. Nowa odsłona Google Lyria 3 Pro ma rozwiązać największe bolączki twórców. Pozwoli na produkcję długich oraz niezwykle złożonyc...
Nowy model Google DeepMind pozwala różnym robotom dzielić się zadaniami, śledzić własne postępy i zatrzymywać się, gdy w pobliżu pojawia się człowiek. Gemini Robotics-ER 2 trafił już do publicznego dostępu przez Gemini API i Google AI Studio.
Niemiecka firma Aleph Alpha opublikowała na Hugging Face pełne wagi modelu Kolibri na licencji Apache 2.0. Rozwiązanie zaprojektowano z myślą o wdrożeniach lokalnych w języku angielskim i niemieckim. Artykuł Aleph Alpha udostępnia Kolibri. Nowy dwuję...
Microsoft AI wypuścił MAI-Transcribe-2, model rozpoznawania mowy obsługujący 60 języków, który firma reklamuje jako najdokładniejszy, najszybszy i najtańszy na rynku. Cena spadła o 72 procent względem poprzedniej wersji.
Nowy model od zespołu Qwen udowadnia, że 7 mld parametrów wystarczy do zaawansowanej edycji obrazów i pracy na warstwach, choć deklarowana przewaga nad zamkniętą konkurencją opiera się na razie na testach producenta. Artykuł Alibaba udostępnia model...
Model d1 wybiera odpowiedzi z określonego z góry zestawu i zwraca ustrukturyzowane prawdopodobieństwa bez generowania tekstu. Usługa jest dostępna wyłącznie przez API Liquid AI. Artykuł Liquid AI udostępnia d1. Model podejmuje decyzje zamiast generow...
MAI-Transcribe-2-Streaming przetwarza mowę w 60 językach i zwraca pierwsze częściowe wyniki po nieco ponad 100 milisekundach. Towarzyszą mu dwa modele syntezy mowy MAI-Voice-2.1. Artykuł Microsoft udostępnia model transkrypcji na żywo i nowe generato...
Neo ma służyć do wybierania narzędzi, oceniania danych lub przekazywania zadań człowiekowi. Choć kod i wagi są publiczne, licencja wyklucza komercyjne wdrożenia bez zgody producenta. Artykuł TokenAI udostępnia Neo: 41-milionowy model do prostych decy...
Google rozszerzył dostępność swojego AI Health Coach od Fitbit na użytkowników iPhone’ów. Usługa, oparta na modelu Gemini, była dotąd dostępna wyłącznie na Androidzie. To ruch zbieżny z doniesieniami, że Apple ogranicza prace nad własnym asystentem z...