La empresa Keenable AI liberó como código abierto NEEDLE, un banco de pruebas para evaluar buscadores y agentes de búsqueda web que reconstruye por completo su conjunto de preguntas cada hora. La idea busca resolver un problema incómodo de la evaluación de estas herramientas: cuando las respuestas correctas viven en un conjunto de datos público, el propio agente puede descargarlas durante la prueba y saltarse la búsqueda que se supone debe medir.

El proyecto, disponible en su sitio oficial y en un repositorio en GitHub, apunta a un vicio conocido en la industria: la contaminación de datos. Si un modelo ya vio las respuestas durante su entrenamiento, o si puede consultarlas en línea mientras se le evalúa, el resultado deja de reflejar su capacidad real de recuperar información.

Por qué un examen que caduca cada hora

Un benchmark es un conjunto estandarizado de tareas con respuestas verificadas que sirve para comparar sistemas bajo las mismas condiciones. El problema, en el caso de la búsqueda web, es que muchos agentes cuentan con una herramienta para descargar páginas (un fetch). Si las respuestas correctas están alojadas en un repositorio público, el agente puede ir directo a esa hoja de respuestas en lugar de buscar la información como lo haría un usuario real.

NEEDLE ataca ese atajo por diseño. En vez de mantener un listado fijo de preguntas y respuestas, genera un nuevo conjunto de consultas cada hora a partir de datos estructurados de Wikidata, la base de conocimiento colaborativa. Como las preguntas expiran y se renuevan constantemente, un sistema no puede memorizarlas de antemano ni descargar la clave: para responder, tiene que buscar de verdad.

Keenable AI publicó además un documento técnico con los detalles de la metodología, y dejó los resultados de las corridas archivados en un conjunto de datos en Hugging Face para que otros puedan revisarlos.

Un problema que crece con los agentes

La preocupación llega en un momento en que los agentes de búsqueda ganan terreno. Estos sistemas no se limitan a devolver enlaces: interpretan una pregunta, consultan varias fuentes, leen su contenido y redactan una respuesta. Herramientas de este tipo, populares entre quienes comparan un buscador con IA como Perplexity frente a los motores tradicionales, dependen justamente de la calidad de esa recuperación. Si los métodos para medirla están viciados, es difícil saber cuál funciona mejor de forma honesta.

NEEDLE se suma a una línea de trabajo académico reciente sobre cómo evaluar sistemas de búsqueda y de investigación automatizada de manera más rigurosa, con propuestas como DeepResearchGym y OpenResearcher, publicadas en el repositorio arXiv. La diferencia del enfoque de Keenable AI está en la rotación horaria de las preguntas, pensada específicamente para cerrar la puerta a la memorización.

Para desarrolladores y empresas de la región que construyen productos sobre APIs de búsqueda, un banco de pruebas abierto y difícil de burlar ofrece un punto de referencia más confiable a la hora de decidir qué proveedor integrar. En mercados donde el presupuesto para infraestructura es ajustado, elegir bien qué motor de recuperación pagar puede marcar la diferencia entre un asistente que responde con datos actuales y uno que inventa.

Qué mirar de aquí en adelante

El valor de una herramienta como NEEDLE dependerá de que la comunidad la adopte y de que los proveedores acepten someterse a una prueba que no pueden preparar con antelación. Al ser de código abierto, cualquiera puede auditar cómo se generan las preguntas y verificar los resultados, algo que rara vez ocurre con las tablas de clasificación que publican las propias empresas sobre sus modelos.

La apuesta de fondo es sencilla de enunciar y difícil de sostener: para medir de verdad si un buscador sabe buscar, el examen tiene que ser imposible de estudiar de memoria.