Najlepsze modele NER w 2026 roku: spaCy, GLiNER, Transformers, LLMs

Tłumaczenie automatyczne Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Rozpoznawanie nazwanych encji (NER) wyszukuje i oznacza fragmenty tekstu, takie jak osoby, firmy i kody produktów. Ta strona jest przeznaczona dla inżynierów wybierających sposób ekstrakcji do obciążenia produkcyjnego. Stanowi punkt wyjścia, który można przetestować względem własnego schematu, dokumentów i ograniczeń operacyjnych.

Użyj spaCy dla stabilnych etykiet i szybkich pipeline’ów. Wybierz GLiNER, gdy etykiety często się zmieniają, bi-encoder, gdy duży zestaw etykiet może ponownie wykorzystywać cache’owane embeddings, albo dostrojony model Transformer do klasyfikacji tokenów, gdy masz oznaczone przykłady. Użyj ekstrakcji strukturalnej opartej na LLM, gdy potrzebujesz złożonego rekordu, a nie prostej listy fragmentów.

Ostatni przegląd: 2026-08-17. Kryteria wyboru: stabilność etykiet, zestaw etykiet, dane wyjściowe w postaci fragmentów lub rekordu, język, dane nadzorowane, opóźnienie, normalizacja i koszt weryfikacji.

Tabela decyzyjna

PotrzebaNajlepszy punkt wyjściaDlaczego
Szybkie NER ze znanymi etykietamispaCyDojrzałe pipeline’y, dobra ergonomia, szybkie wdrożenie na CPU i integracja z regułami.
Nowe etykiety bez pełnego trenowaniaGLiNEREkstrakcja uwarunkowana etykietami dobrze sprawdza się, gdy zestaw etykiet się zmienia. Zacznij od jasnych opisów typów, nie od samych nazw.
Duży zestaw etykiet wielokrotnego użytkubi-encoder GLiNERMoże wstępnie obliczać i cache’ować embeddings etykiet zamiast kodować etykiety dla każdego dokumentu.
Encje i relacje w jednym przebieguKandydat: GLiNER-RelexWspólnie ekstrahuje typy encji i relacji. Porównaj go z osobnymi etapami na docelowym schemacie relacji.
Encje oraz pola dokumentu lub klasyfikacjaGLiNER2Jego interfejs schematu łączy rozpoznawanie encji, klasyfikację i zadania ekstrakcji strukturalnej.
Zagnieżdżone lub nakładające się encjeDekoder obsługujący zagnieżdżenia, w tym GLiNER z flat_ner=FalsePłaskie dekodowanie eliminuje nakładanie się encji. Testuj zagnieżdżone fragmenty na adnotacjach zawierających oczekiwane wzorce nakładania.
Ekstrakcja wielojęzyczna lub obejmująca wiele skryptówGLiNER-X lub model bazowy XLM-RŻaden model nie wygrywa dla każdego języka. Testuj każdy docelowy język oraz sposób formułowania opisów typów.
Stabilne etykiety domenowe i reprezentatywne oznaczone fragmentyDostrojony klasyfikator tokenów lub pipeline spaCyUstal bazowy wynik nadzorowany, a następnie porównaj exact-span F1, opóźnienie i koszt na zbiorze domenowym.
Implicytne, międzyzdaniowe lub strukturalne polaLLM lub rozwiązanie hybrydoweDane wyjściowe o strukturze ograniczają kształt odpowiedzi, ale nie gwarantują poprawności ekstrakcji. Waliduj dokładność pól na domenowym zbiorze testowym.
Wysokie ryzyko PII lub proces regulowanyPresidio oraz kandydat GLiNER2-PIIPołącz dane wyjściowe modelu z deterministycznymi kontrolami, mechanizmami redakcji i weryfikacją.

Klasy narzędzi

KlasaMocna stronaSłabośćDobre zastosowanie
NER w spaCySzybkość, gotowość produkcyjna, obsługa regułDo niestandardowych etykiet wymaga trenowania lub regułZnane etykiety w systemach o dużej przepustowości.
GLiNERElastyczne etykiety w czasie inferencjiJakość zależy od sformułowania etykiet i niedopasowania domenySzybka iteracja ontologii i etykiety long-tail.
Bi-encoder GLiNERCache’owane embeddings etykiet skalują się do dużych ontologiiKorzyści zależą od ponownego użycia etykiet i charakterystyki obciążeniaZestawy etykiet używane ponownie — od dziesiątek do tysięcy.
GLiNER2Ekstrakcja schematów wielozadaniowychKażde zadanie i połączony schemat nadal wymagają ewaluacjiEncje, klasyfikacja i pola strukturalne.
GLiNER-RelexWspólna ekstrakcja encji i relacjiNowszy model wymagający porównań specyficznych dla zadaniaJawne schematy encja–relacja.
Klasyfikator tokenów TransformerWysoka dokładność nadzorowanaWymaga oznaczonych fragmentów i ponownego trenowaniaStabilna ekstrakcja domenowa przy wystarczającej ilości danych.
Ekstrakcja LLMElastyczność schematu i rozumowanieWiększe opóźnienie, koszt i niedeterminizmZłożone rekordy, wartości implicytne i procesy o małej liczbie żądań.
Reguły i słownikiDeterministyczne dopasowywanieKruchy recallZgodność, identyfikatory, kody produktów i filtry końcowe.

Jak wybrać

Zacznij od schematu encji, a nie od modelu.

Jeśli etykiety są stabilne i dostępne są reprezentatywne przykłady, dostrój klasyfikator tokenów. Porównaj go na wydzielonym zbiorze domenowym. Model przewiduje etykiety tokenów bez autoregresywnego generowania. Opóźnienie i koszt nadal zależą od modelu, sprzętu, rozmiaru batcha i stosu serwującego.

Jeśli etykiety zmieniają się co tydzień, użyj GLiNER lub ekstraktora LLM, dopóki ontologia się nie ustabilizuje. Napisz krótki opis typu dla każdej niejednoznacznej etykiety. Najnowsze badania nad hard zero-shot NER pokazują, że opisy poprawiają generalizację i zapobiegają uznawaniu wycieku etykiet za zdolność zero-shot. Celem jest ustalenie, jak powinien wyglądać schemat, zanim przeznaczysz budżet na adnotacje.

Jeśli ponownie wykorzystujesz duży zestaw etykiet, przed wspólnym enkoderem etykieta–tekst oceń bi-encoder. W artykule o bi-encoderze GLiNER odnotowano 61,5 micro-F1 na CrossNER. Autorzy raportują również do 130 razy większą przepustowość przy 1024 etykietach i wstępnie obliczonych embeddings, w warunkach testowych z użyciem H100. Wyniki te pokazują sposób skalowania. Nie są estymacją dla innego obciążenia produkcyjnego.

Jeśli dokumenty obejmują kilka języków, wykonaj benchmark dla każdego docelowego języka i skryptu. OpenNER 1.0 wykazał, że żaden pojedynczy model nie osiąga najlepszych wyników w całym zbiorze obejmującym 52 języki. Testuj zarówno opisy typów po angielsku, jak i lokalizowane, ponieważ tekst etykiety jest częścią wejścia modelu.

Jeśli dane wyjściowe są ustrukturyzowanym rekordem, a nie fragmentami, użyj LLM z ustrukturyzowanymi danymi wyjściowymi lub pipeline’u hybrydowego. LangExtract jest przydatny, gdy każda ekstrakcja musi wskazywać swoją lokalizację źródłową. NuExtract to opcja self-hosted do multimodalnej ekstrakcji dokumentów. Oba rozwiązania nadal wymagają ewaluacji na poziomie pól dla docelowych dokumentów.

Wiele biznesowych zadań ekstrakcji nie jest czystym NER. „Znajdź strony, zobowiązania, datę wejścia w życie, klauzulę wypowiedzenia i prawo właściwe” to rozumienie dokumentu z polami encji.

W przypadku PII użyj frameworka PII, takiego jak Presidio, jako warstwy integracji i redakcji. Traktuj GLiNER2-PII jako kandydata na model, a nie jako decyzję dotyczącą zgodności. Zmierz recall dla wrażliwych formatów, języków i dokumentów, które system będzie przetwarzać.

Pipeline produkcyjny

Produkcyjny pipeline ekstrakcji często dodaje wokół modelu kolejne etapy:

  1. Ekstrakcja kandydatów: spaCy, GLiNER, model Transformer, LLM, reguły lub ich kombinacja.
  2. Opcjonalna normalizacja lub entity linking: mapowanie fragmentów na kanoniczne identyfikatory, kody produktów, użytkowników, firmy lub wpisy ontologii.
  3. Walidacja i weryfikacja: odrzucanie niemożliwych etykiet, egzekwowanie ograniczeń schematu, usuwanie zduplikowanych fragmentów i kierowanie niepewnych przypadków do weryfikacji.

Normalizacja przekształca wyekstrahowany tekst w użyteczne dane produktowe. Znalezienie fragmentu „Apple” to dopiero pierwszy krok. System nadal musi ustalić, czy chodzi o firmę, owoc, rodzinę produktów czy ticker giełdowy, a następnie przypisać stabilny identyfikator.

Lista kontrolna ewaluacji

Mierz więcej niż F1 na poziomie encji:

  • exact span F1
  • relaxed span F1
  • macierz pomyłek etykiet
  • obsługa zagnieżdżonych encji
  • dokładność normalizacji encji
  • wrażliwość na opisy typów i język etykiet
  • przekroje według języka, skryptu i formatu dokumentu
  • false positives według etykiety
  • kalibracja confidence
  • opóźnienie i koszt na dokument
  • odsetek korekt dokonywanych przez człowieka

Trzymaj zbiór testowy oddzielnie od projektowania schematu i dostrajania progów. Raportuj liczbę dokumentów i wzmianek o encjach dla każdej etykiety. Używaj przedziałów ufności na poziomie dokumentu, ponieważ wielokrotne wzmianki w jednym dokumencie mogłyby w przeciwnym razie sztucznie zawyżać pewność.

Dalsza lektura

Referencje