La búsqueda en lenguaje natural permite a los usuarios encontrar contenido describiendo lo que necesitan con un lenguaje sencillo y conversacional, en lugar de usar palabras clave exactas, clasificando los resultados según su significado mediante incrustaciones (embeddings) de IA. Relaciona las consultas con el contenido basándose en el significado de las cosas, no solo en las palabras utilizadas para describirlas.
La búsqueda por palabras clave compara los términos literales de una consulta con las palabras de un documento o sus etiquetas; falla cuando las palabras del usuario difieren de las del contenido, incluso si el significado es idéntico. La búsqueda en lenguaje natural convierte tanto la consulta como el contenido en incrustaciones —representaciones numéricas del significado— y los empareja por similitud. Así, "el CEO anunciando el producto" encuentra el clip o la diapositiva correcta, aunque ninguna de esas palabras exactas se haya escrito nunca como etiqueta.
La búsqueda en lenguaje natural depende de que el contenido ya haya sido procesado: OCR para hacer legibles los documentos escaneados, transcripción para que el audio y el video sean buscables palabra por palabra, y modelos de visión para describir lo que representan las imágenes y los fotogramas de video. Una vez que esa comprensión existe como metadatos, una capa de búsqueda basada en incrustaciones puede responder preguntas sencillas en toda la biblioteca, en lugar de solo en la pequeña parte que alguien etiquetó manualmente.
Dado que la búsqueda en lenguaje natural depende de modelos de IA para generar incrustaciones, el lugar donde se ejecutan estos modelos es crucial para el contenido regulado: las API en la nube envían consultas y contexto a terceros, mientras que las implementaciones locales o con modelos propios (BYOLLM) mantienen todo el proceso de búsqueda dentro del perímetro de la organización, un requisito para muchas bibliotecas de contenido gubernamental, sanitario y financiero.
ioPilot, el motor de IA de ioMoVo, ofrece búsqueda en lenguaje natural en documentos, imágenes y videos indexados por fotogramas. Es multilingüe, respeta los permisos y cuenta con soporte BYOLLM para que los modelos subyacentes puedan ejecutarse completamente dentro de su propio entorno. Consulte la página de ioPilot.
La mayoría de las plataformas maduras utilizan ambas: coincidencia de palabras clave para términos exactos como códigos de producto, y coincidencia semántica para consultas conversacionales basadas en el significado, utilizándolas de forma combinada según lo que escriba el usuario.
Sí, cuando se combina con visión artificial y transcripción, la misma coincidencia semántica se aplica a lo que se muestra en una imagen o se dice en un video, no solo al texto escrito.