Actualidad

Legal Benchmarks lanza el primer marco abierto y estandarizado para evaluar herramientas de IA legal

El autor del post  Redacción Redacción
- de lectura

Legal Benchmarks anuncia hoy el lanzamiento del Legal AI Evaluation Framework, el primer marco abierto y colaborativo diseñado para ofrecer evaluaciones defendibles y basadas en evidencia de herramientas de inteligencia artificial aplicadas al ámbito jurídico.

Legal Benchmarks anuncia hoy el lanzamiento del Legal AI Evaluation Framework, el primer marco abierto y colaborativo diseñado para ofrecer evaluaciones defendibles y basadas en evidencia de herramientas de inteligencia artificial aplicadas al ámbito jurídico. El lanzamiento incluye también un Evaluation Toolkit con scorecards operativos y checklists para apoyar a los equipos jurídicos en decisiones de compra más rigurosas y transparentes.

El marco ha sido co-desarrollado por más de 100 líderes jurídicos de 82 organizaciones y despachos en 25 países, convirtiéndose en una de las iniciativas de estandarización lideradas por compradores más amplias y coordinadas en la historia reciente del sector legal.

Un proceso de compra roto en un mercado saturado

Los equipos jurídicos afrontan una presión creciente para adoptar IA, pero la selección de herramientas se ha vuelto cada vez más compleja:

  • Las actualizaciones de modelos cada 2–3 meses alteran el rendimiento y la fiabilidad de las soluciones.
  • Existen más de 800 herramientas de IA legal, muchas con afirmaciones similares y escasa transparencia técnica.
  • Las decisiones de compra siguen dependiendo en exceso de demos comerciales y materiales de marketing.

“Las organizaciones necesitan una forma estructurada, independiente y basada en evidencia para evaluar herramientas de IA legal. El mercado se mueve demasiado rápido para confiar únicamente en las promesas de los proveedores”, afirma Anna Guo, fundadora de Legal Benchmarks.

Tres etapas para una evaluación rigurosa

El Legal AI Evaluation Framework introduce un proceso de evaluación en tres fases:

  1. Pre-Demo Vetting — Cribado inicial basado en información pública y documentación del proveedor.
  2. Demo Validation — Verificación en vivo de las afirmaciones del proveedor usando flujos de trabajo y documentos reales.
  3. Pilot Evaluation — Evaluación práctica con usuarios reales y tareas jurídicas auténticas.

El marco analiza cada solución según ocho criterios esenciales:

  • Alineación estratégica: ajuste a casos de uso legales, sistemas de TI, jurisdicciones, idiomas y necesidades a largo plazo del equipo jurídico.
  • Funcionalidad: diseño de la interfaz, integración en flujos de trabajo, personalización, manejo de inputs y usabilidad real dentro de los stacks tecnológicos existentes.
  • Robustez: exactitud factual, completitud, fidelidad a instrucciones, verificabilidad, calidad de citas y consistencia de los outputs generados por IA en tareas legales.
  • Seguridad: transparencia de arquitectura y flujos de datos, control de acceso, límites de recuperación, resistencia adversarial, seguridad de IA y alineación con políticas internas de seguridad.
  • Privacidad de datos: restricciones de uso de datos (incluyendo cláusulas de no entrenamiento sobre datos agregados o derivados), eliminación, localización, gobernanza de embeddings y prácticas de subprocesadores.
  • Riesgo del proveedor: licencias, compromisos contractuales de seguridad, portabilidad de datos, trazabilidad, transparencia, historial del proveedor, continuidad de negocio y respuesta ante incidentes.
  • Soporte para la adopción: formación, soporte, resolución de incidencias, documentación e informes de uso para facilitar el despliegue y la adopción sostenida.
  • Coste total de propiedad: modelo de precios, coste total de propiedad y capacidad operativa interna necesaria para desplegar y mantener la herramienta.

Un mercado sin lealtad: los compradores mantienen sus opciones abiertas

Los datos recopilados por Legal Benchmarks revelan un fenómeno notable: entre 18 equipos jurídicos que ya utilizan IA, solo 1 (6%) se considera comprometido con su proveedor actual. El resto está evaluando alternativas o planea cambiar de solución.

A pesar de la percepción de que algunos proveedores han “ganado” el mercado, el comportamiento real de los compradores muestra un entorno altamente competitivo y en constante revisión.

Una iniciativa independiente y liderada por profesionales

  • Gobernanza: El proyecto está supervisado por un Equipo Central, un Consejo Asesor y un Comité Directivo compuesto por expertos en derecho e IA.
  • Independencia: El proyecto es actualmente autofinanciado; ningún proveedor ha pagado para influir en los criterios o la metodología.
  • Participación: Todos los colaboradores han contribuido de forma voluntaria. Cualquier cambio futuro en el modelo de financiación será comunicado públicamente.

Acerca de Legal Benchmarks

Legal Benchmarks es la capa de confianza y validación para la IA legal. Su misión es proporcionar evaluaciones independientes, rigurosas y transparentes que permitan a los equipos jurídicos adoptar IA con seguridad, claridad y evidencia verificable.