Powstała nowa rodzina polskich modeli językowych do wyszukiwania informacji

Fot. Adobe Stock
Fot. Adobe Stock

Działający w ramach Ośrodka Przetwarzania Informacji (OPI) AI Lab opracował nową rodzinę modeli językowych PolDense przeznaczonych do wyszukiwania informacji. Jak informuje placówka, w publicznym rankingu PIRB model Poldense zajmuje pierwsze miejsce pod względem skuteczności działania.

Modele PolDense powstały w celu pracy na systemach pracujących z dużymi wolumenami danych nieustrukturyzowanych, w szczególności w wyszukiwarkach, chatbotach, asystentach AI oraz aplikacjach wykorzystujących popularną obecnie architekturę RAG (Retrieval Augmented Generation).

– Udostępnienie modeli PolDense to kolejny krok w budowaniu polskich kompetencji w obszarze sztucznej inteligencji. Tworzymy otwarte technologie, które mogą być wykorzystywane przez naukowców, administrację publiczną i przedsiębiorców do budowy nowoczesnych, efektywnych i bezpiecznych narzędzi AI. Warto podkreślić, że jeden z nowych modeli OPI jest na pierwszym miejscu wg Polish Information Retrieval Benchmark (PIRB), wyprzedzając wielojęzyczne modele typu llama czy bge – podkreśla dr hab. inż. Jarosław Protasiewicz, dyrektor Ośrodka Przetwarzania Informacji - Państwowego Instytutu Badawczego.

Rodzina PolDense obejmuje sześć modeli opartych na architekturze ModernBERT i technologii ettin-encoders. Modele posiadają od 17 milionów do 1 miliarda parametrów, co pozwala dobrać rozwiązanie zarówno do wdrożeń wymagających najwyższej jakości, jak i do środowisk o ograniczonych zasobach sprzętowych. Modele potrafią analizować teksty o długości nawet 8192 tokenów, dzięki czemu lepiej zachowują kontekst długich dokumentów oraz skuteczniej identyfikują najbardziej trafne informacje.

Największy model z rodziny – PolDense 1B – osiągnął wynik 64,11 punktu w benchmarku PIRB, wyprzedzając znacznie większe modele wielojęzyczne, takie jak Llama-Embed-Nemotron-8B (63,73) oraz BGE-Multilingual-Gemma2-9B (63,26).

Modele o wielkości 400 mln i 150 mln parametrów oferują bardzo konkurencyjne wyniki względem rozwiązań posiadających kilka miliardów parametrów, natomiast najmniejsze warianty – 68 mln, 32 mln i 17 mln parametrów – zostały zaprojektowane z myślą o wdrożeniach na procesorach CPU, urządzeniach mobilnych oraz środowiskach edge computing.

Modele PolDense zostały udostępnione przez Ośrodek Przetwarzania Informacji jako rozwiązania open source. Dzięki temu mogą być wykorzystywane do budowy własnych mechanizmów wyszukiwania, systemów RAG i narzędzi wspierających pracę z bazami dokumentów. Zastosowanie modeli PolDense pozwala nie tylko poprawić jakość wyszukiwania informacji, lecz także obniżyć koszty wdrożeń poprzez wykorzystanie mniejszych i bardziej efektywnych obliczeniowo modeli bez utraty wysokiej skuteczności działania.

Dr inż. Marek Kozłowski, kierownik AI Lab w Ośrodku Przetwarzania Informacji, podkreśla znaczenie modeli opracowanych w OPI dla różnego rodzaju użytkowników.

– PolDense pokazuje, że można tworzyć modele wyspecjalizowane dla języka polskiego, które nie tylko konkurują z największymi rozwiązaniami światowymi, ale w wielu specyficznych zadaniach osiągają od nich lepsze wyniki. Naszym celem było opracowanie rodziny modeli odpowiadającej na potrzeby bardzo różnych zastosowań – od dużych systemów korporacyjnych, po lekkie wdrożenia działające lokalnie. Wszystkie modele udostępniamy za darmo na platformie Hugging Face, aby wspierać rozwój polskiego ekosystemu AI – podsumowuje Kozłowski.

W kolejnych miesiącach AI Lab OPI planuje udostępnienie modelu EuroDense, który wspiera wyszukiwanie informacji w dziewięciu językach europejskich.

Modele PolDense zostały opracowane w ramach projektu Large Language Models for the European Union (LLMs4EU) realizowanego przez konsorcjum Alliance for Language Technologies – ALT-EDIC. Celem projektu jest rozwój i udostępnianie modeli, narzędzi oraz usług opartych na sztucznej inteligencji dla pięciu kluczowych sektorów: nauki, usług publicznych, turystyki, telekomunikacji oraz energetyki. Projekt ma zachęcać do wykorzystywania europejskich technologii AI przez instytucje publiczne oraz małe i średnie przedsiębiorstwa. LLMs4EU jest współfinansowany ze środków UE w ramach programu Digital Europe Programme oraz Ministerstwa Cyfryzacji. Modele PolDense dostępne są za darmo na platformie Hugging Face. (PAP)

Nauka w Polsce

masz/ bar/

Fundacja PAP zezwala na bezpłatny przedruk artykułów z Serwisu Nauka w Polsce pod warunkiem mailowego poinformowania nas raz w miesiącu o fakcie korzystania z serwisu oraz podania źródła artykułu. W portalach i serwisach internetowych prosimy o zamieszczenie podlinkowanego adresu: Źródło: naukawpolsce.pl, a w czasopismach adnotacji: Źródło: Serwis Nauka w Polsce - naukawpolsce.pl. Powyższe zezwolenie nie dotyczy: informacji z kategorii "Świat" oraz wszelkich fotografii i materiałów wideo.

Czytaj także

  • Fot. Adobe Stock

    Raport o dezinformacji medycznej: 54 proc. narracji dotyczy szczepień

  • Fot. Adobe Stock

    Fizycy: powinniśmy zwracać większą uwagę na jakość relacji społecznych

Przed dodaniem komentarza prosimy o zapoznanie z Regulaminem forum serwisu Nauka w Polsce.

newsletter

Zapraszamy do zapisania się do naszego newslettera