[!NOTE] Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Los mejores modelos NER de 2026
El reconocimiento de entidades nombradas (NER) permite localizar y etiquetar segmentos de texto, como personas, empresas o códigos de producto. Un sistema en producción también debe normalizar dichos segmentos, validar los resultados obtenidos, respetar un límite de latencia establecido y dirigir aquellos casos inciertos a un proceso de revisión. Por lo tanto, la calidad del modelo depende en primer lugar de cuán estables sean las etiquetas que se utilicen.
Utilice spaCy para obtener etiquetas estables y un proceso pipelines rápido. Elija GLiNER cuando las etiquetas cambian con frecuencia, o ajuste un clasificador de tokens basado en Transformer cuando cuente con ejemplos ya etiquetados. Empiece a utilizar la extracción estructurada basada en LLM cuando necesite un registro complejo en lugar de una simple lista de segmentos.
Tabla de decisiones
| El punto de partida óptimo | ¿Por qué? | |
|---|---|---|
| Etiquetado rápido con etiquetas conocidas NER | Un pipelines maduro, con una buena ergonomía, una rápida implementación de CPU y posibilidad de integración de reglas. | |
| Nuevas etiquetas sin entrenamiento completo | GLiNER | |
| La más alta calidad para etiquetas de dominio estables | Clasificador de tokens de Transformer afinado | |
| Extracción de esquemas complejos | LLM junto con structured outputs | Es más adecuado para campos anidados, atributos dispersos y razonamiento entre oraciones. |
| Flujo de trabajo de producción regulado | Modelo híbrido combinado con reglas y revisión | El determinismo, la auditabilidad y el enrutamiento basado en confianza son aspectos cruciales. |
Clases de herramientas
| Clase | Fuerza | Debilidad | Adecuación óptima |
|---|---|---|---|
| spaCy NER | Rápido, apto para producción y consciente de reglas. | Se requieren entrenamiento o reglas para las etiquetas personalizadas. | Etiquetas conocidas en sistemas de alto rendimiento. |
| GLiNER | Etiquetas flexibles en el momento de la inferencia | La calidad depende de la redacción de las etiquetas y de la falta de coincidencia entre el dominio. | Iteración rápida de ontologías y etiquetas de cola larga. |
| Clasificador de tokens Transformer | Precisión con supervisión fuerte | Requiere segmentos etiquetados y un nuevo entrenamiento. | Extracción estable de dominios con una cantidad suficiente de datos. |
| LLM extracción | Flexibilidad del esquema y razonamiento | Mayor latencia, coste y no determinismo | Registros complejos, campos anidados y flujos de trabajo de bajo volumen. |
| Reglas y diccionarios | Precisión determinística | Recuperación frágil | Cumplimiento normativo, identificadores, códigos de producto y filtros posteriores. |
Cómo elegir
Comience con el esquema de entidades, y no con el modelo.
Si las etiquetas son estables y existen ejemplos suficientes, se puede entrenar o ajustar finamente un clasificador de tokens. Este enfoque resulta más sencillo de evaluar, es menos costoso de ejecutar y ofrece un comportamiento más predecible que una cadena de extracción basada en LLM.
Si las etiquetas cambian semanalmente, se debe utilizar GLiNER o un extractor de tipo LLM mientras la ontología se estabiliza. El objetivo es aprender cuál debería ser el esquema antes de invertir el presupuesto destinado a la anotación.
Si el resultado es un registro estructurado en lugar de segmentos sueltos, se debe utilizar LLM junto con structured outputs o un formato híbrido basado en pipeline. Muchas tareas de extracción de información empresarial no corresponden a un proceso puramente NER. La tarea de “identificar las partes involucradas, las obligaciones, la fecha de entrada en vigor, la cláusula de terminación y la legislación aplicable” constituye una forma de comprensión de documentos que implica la identificación de campos relacionados con entidades.
Patrón de producción
Un sistema NER en producción suele contar con tres niveles:
- Extracción de candidatos: spaCy, GLiNER, modelo Transformer, LLM, reglas, o una combinación de ellos.
- Normalización: mapeo de los intervalos a identificadores canónicos, códigos de producto, usuarios, empresas o entradas de ontología.
- Validación: rechazo de etiquetas imposibles, aplicación de restricciones del esquema, eliminación de duplicados en los intervalos, y derivación de los casos de baja confianza para su revisión.
La normalización convierte el texto extraído en datos de producto útiles. Encontrar la secuencia “Apple” es solo el primer paso. El sistema debe decidir aún si se refiere a la empresa, al fruto, a una familia de productos o a un código bursátil, y posteriormente asignarle un ID estable.
Lista de verificación de evaluación
Mida algo más que el F1 a nivel de entidad:
- rango exacto F1
- rango relajado F1
- matriz de confusión por etiqueta
- manejo de entidades anidadas
- precisión en la normalización de entidades
- falsos positivos por etiqueta
- calibración de confianza
- latencia y costo por documento
- tasa de corrección humana
Lectura adicional
- La guía definitiva sobre NER en 2026 Aborda los codificadores, LLMs, y la arquitectura de producción de tres capas. Razonamiento guiado por esquema en vLLM Es relevante cuando NER pasa a ser una extracción estructurada.