La española sigma.ai  ha publicado una nota de prensa anunciando: Lanzamiento de Sigma Eval: Un…

La española sigma.ai  ha publicado una nota de prensa anunciando:
  • Lanzamiento de Sigma Eval: Un servicio independiente de auditoría y verificación continua para agentes conversacionales de IA empresariales, diseñado para operar tanto en la fase previa al lanzamiento como en la monitorización post-despliegue.

  • Separación de roles: Sigma no desarrolla el modelo ni define los prompts; actúa exclusivamente como un evaluador externo e imparcial para garantizar resultados objetivos ante directivas, clientes y reguladores.

Aquí tienes un resumen estructurado con los puntos clave del comunicado de prensa de Sigma AI Group:

Problema que resuelve

  • Falsa seguridad interna: Un 50 % de las empresas reporta que sus agentes fallaron ante clientes reales a pesar de haber superado pruebas internas (según datos de VentureBeat citados en el texto).
  • Deriva operativa (model drift): Con el tiempo, cambios en los modelos, prompts o bases de conocimiento degradan la precisión y seguridad de los agentes, haciendo insuficiente una única prueba inicial.

Metodología: 12 dimensiones de evaluación

El servicio analiza el comportamiento del agente mediante usuarios y conversaciones sintéticas multilingües, desglosando los resultados en tres categorías (sin promedios agregados que oculten fallos):
Categoría Dimensiones evaluadas
Seguridad Sesgo, toxicidad, alucinaciones, opacidad, exposición de PII (datos personales) y vulnerabilidad a manipulación.
Experiencia de usuario Desalineación de contexto, inconsistencia conversacional y desinterés del usuario.
Rendimiento Rendimiento de trayectoria, esfuerzo del cliente y coste de resolución.

Características de implementación y privacidad

  • Sin integración técnica: No requiere acceso a código fuente ni APIs internas; se evalúa directamente a través del enlace público del agente conversacional y un contexto operativo básico.
  • Confidencialidad estricta: Los informes generados son privados y no se emplean para comparativas públicas ni materiales de marketing.
  • Condiciones de acceso: El servicio debuta ofreciendo un primer informe de evaluación gratuito para cualquier organización con un agente en funcionamiento, junto con evaluaciones de seguimiento limitadas para medir correcciones.
  • Ecosistema complementario: Se apoya en Sigma Cypher para la anonimización previa de datos personales identificables (PII).

La explicación de Gemini

Las empresas están adoptando agentes conversacionales a un ritmo vertiginoso en áreas críticas como atención al cliente, ventas o soporte técnico. Sin embargo, existe un desajuste evidente entre la velocidad de despliegue y las garantías reales de funcionamiento: la mitad de las organizaciones admite haber lanzado sistemas de IA que superaron con éxito los tests internos pero acabaron fallando ante clientes reales.

Para responder a este problema y a la creciente presión regulatoria en torno a la gobernanza algorítmica, la compañía tecnológica Sigma ha presentado Sigma Eval, un servicio de verificación independiente diseñado para evaluar agentes de IA tanto antes de su lanzamiento como de forma continua tras su puesta en marcha.

La necesidad de un «ojo externo» en la IA

El enfoque central de la propuesta reside en la imparcialidad. Históricamente, las organizaciones han confiado en las métricas de los propios proveedores que construyeron el modelo o en revisiones manuales anecdóticas. La tesis de Sigma es que la garantía de fiabilidad debe provenir siempre de fuera del sistema evaluado.
«Las empresas no deberían tener que adivinar si su agente de IA es bueno. Deberían poder saberlo. La verificación independiente es lo que convierte una suposición interna en algo en lo que un consejo de administración, un regulador o un cliente pueden confiar», subraya el Dr. Daniel Tapias, CEO de Sigma.
Este análisis externo cobra especial relevancia ante el fenómeno de la deriva operativa (drift). Los agentes no son estáticos: las bases de conocimiento corporativas se actualizan, los modelos fundacionales reciben ajustes y los prompts se modifican con frecuencia. Un asistente conversacional que resultaba seguro y preciso durante su despliegue inicial puede presentar brechas críticas meses después.

Doce dimensiones bajo la lupa

Sigma Eval no construye modelos ni redacta instrucciones; somete al agente a escenarios de estrés mediante usuarios y conversaciones sintéticas multilingües. El sistema genera diagnósticos desglosados en 12 dimensiones agrupadas en tres ejes operativos:
  • Seguridad y cumplimiento: Detección de sesgos, toxicidad, alucinaciones factuales, falta de transparencia, fuga de datos personales (PII) y resistencia ante técnicas de manipulación (jailbreaks o usuarios adversarios).
  • Experiencia de usuario (UX): Consistencia del diálogo, mantenimiento del contexto a lo largo de interacciones complejas y retención del interés del usuario.
  • Rendimiento operativo: Eficacia en la resolución de objetivos (task completion), medición del esfuerzo requerido por parte del cliente y coste de resolución de la consulta.
El servicio evita emitir una nota media generalizada, una práctica que a menudo enmascara graves riesgos de seguridad detrás de métricas comerciales aparentemente positivas.

Despliegue sin fricción técnica

Uno de los puntos clave para su adopción técnica es la ausencia de integración interna. El servicio opera como una auditoría de «caja negra»: la empresa solicitante únicamente proporciona el enlace público de su asistente junto con el contexto operativo básico (objetivos del bot, idiomas soportados y casos límite conocidos), sin necesidad de abrir el código fuente ni conceder acceso a APIs internas.
Los informes resultantes son estrictamente confidenciales y la compañía ha habilitado un primer diagnóstico gratuito para las organizaciones interesadas en someter a examen a sus agentes en producción.

La Nota de prensa de Sigma

News Provided By
Sigma AI Group LLC
September 22, 2026, 08:30 GMT

_Sigma Eval es un servicio de verificación independiente para agentes de IA empresariales que combina evaluación continua con supervisión humana._

«Las empresas no deberían tener que adivinar si su agente de IA es bueno. Deberían poder saberlo. La verificación independiente es lo que convierte una suposición interna en algo en lo que un consejo de administración, un regulador o un cliente pueden confiar».
— Daniel Tapias, CEO de Sigma Group

MADRID, SPAIN, September 22, 2026 /EINPresswire.com/ — Sigma ha anunciado hoy el lanzamiento de Sigma Eval. El servicio de verificación aporta una capa de garantía independiente para evaluar sistemas conversacionales de IA en 12 dimensiones de seguridad, experiencia de usuario y rendimiento, tanto antes como después del despliegue.

El lanzamiento responde a las nuevas exigencias de la gobernanza de la IA para los agentes conversacionales empresariales. Sigma Eval ofrece a las organizaciones una valoración imparcial y basada en evidencias de cómo se comportan sus sistemas conversacionales de IA con usuarios reales, y no de cómo se espera que se comporten en una demostración controlada.

La distancia entre el despliegue de la IA y su verificación independiente es ya visible, con consecuencias para empresas y sus clientes. Un estudio sectorial de 2026 reveló que el 57 % de las organizaciones tiene agentes de IA en producción, y solo el 52 % afirma realizar evaluaciones offline (LangChain). En otro estudio, el 50 % declaró haber desplegado un agente de IA o una funcionalidad basada en LLM que había superado las evaluaciones internas y que, sin embargo, provocó después un fallo ante el cliente (Venturebeat).

Las empresas están desplegando agentes conversacionales en atención al cliente, ventas, gestión de siniestros y soporte interno más rápido de lo que pueden ser verificados. La mayoría sigue confiando en el criterio de los proveedores que construyeron el sistema, en pruebas anecdóticas o en pocas conversaciones de muestra revisadas a mano. La posición de Sigma es clara: la garantía debe venir de fuera del sistema que se garantiza.

«Las empresas no deberían tener que adivinar si su agente de IA es bueno. Deberían poder saberlo. La verificación independiente es lo que convierte una suposición interna en algo en lo que un consejo de administración, un regulador o un cliente pueden confiar», afirmó el Dr. Daniel Tapias, CEO de Sigma.

### Una capa de garantía, no otra herramienta de IA

Sigma Eval se sitúa junto al stack de IA. La compañía no construye el agente, ni ajusta el modelo, ni proporciona los prompts: mide el comportamiento resultante. Esa separación es deliberada y permite que el resultado funcione como garantía: un veredicto externo emitido por una empresa que no tiene interés en el resultado.

El servicio está diseñado para usarse a lo largo del ciclo de vida de un sistema de IA. Antes del despliegue, actúa como control previo al lanzamiento: las organizaciones pueden ver cómo gestiona el agente a usuarios adversarios, datos sensibles, presión fuera de tema y peticiones sin resolver antes de que un cliente se encuentre con él. Después del despliegue se convierte en instrumento de monitorización, porque los agentes derivan. Los prompts se editan, los modelos se actualizan, las bases de conocimiento cambian y las integraciones se mueven. Un agente que era seguro en marzo no lo es necesariamente en septiembre. La verificación periódica hace visible esa deriva.

### Doce dimensiones en tres categorías

Cada evaluación puntúa al agente en 12 dimensiones agrupadas en tres categorías:
* Seguridad: la exposición reputacional, legal y financiera derivada del mal comportamiento del sistema: sesgo, toxicidad, alucinaciones, opacidad, exposición de PII y vulnerabilidad a la manipulación.
* Experiencia de usuario: cómo mantiene el agente la conversación y al usuario enfocado en ella: desalineación del contexto, inconsistencia conversacional y desinterés del usuario.
* Rendimiento: con qué eficacia el agente lleva al usuario hacia su objetivo: rendimiento de trayectoria, esfuerzo del cliente y coste de resolución.

La evidencia se genera con un sistema propietario que combina usuarios sintéticos con conversaciones sintéticas, ejercitando el agente a escala y en cualquier idioma. En lugar de una única puntuación agregada, los clientes reciben un informe que reporta cada dimensión por separado, de modo que un buen resultado comercial no pueda ocultar una debilidad de seguridad, ni al contrario.

### Sencillez de uso

El servicio no requiere trabajo de integración ni acceso al código o al modelo. La organización envía el enlace público de su agente conversacional, junto con unos datos de contacto básicos y cualquier contexto relevante: el propósito del agente, sus idiomas, sus KPIs y sus casos límite conocidos. Sigma Cognition ejecuta la evaluación y entrega un informe confidencial.

La confidencialidad es una condición del servicio, no una opción. Los informes se comparten únicamente con la organización solicitante y nunca se utilizan como material público de benchmarking ni como contenido promocional.
Sigma abre el servicio con un informe de evaluación gratuito, disponible para cualquier organización que opere un agente conversacional. La compañía también pone a disposición un número limitado de evaluaciones repetidas para que los equipos puedan verificar el efecto del trabajo de corrección, y no solo recibir un diagnóstico.

### Sigma Eval responde a las nuevas exigencias de la gobernanza de la IA

El lanzamiento responde a una necesidad del mercado ante el cambio en la forma de gobernar los sistemas de IA: las organizaciones prestan cada vez más atención a cómo y quién evalúa los sistemas de alto impacto, y con qué evidencias. La evaluación independiente por terceros es el mecanismo que la mayoría de los sectores regulados ya reconoce en la información financiera, en la seguridad de producto y en la seguridad informática. La IA está llegando al mismo punto.
El trabajo de verificación de Sigma se apoya en investigación aplicada en seguridad de la IA, evaluación y anonimización, desarrollada con socios académicos e institucionales. Esa base de investigación sustenta Sigma Eval y su producto complementario Sigma Cypher, que anonimiza la información personal identificable antes del análisis.

¿Que hace Sigma?

Sigma (Sigma AI / Sigma Group) es una compañía B2B especializada en servicios de datos para inteligencia artificial, gobernanza y auditoría de modelos.
Históricamente nació en el ámbito del procesamiento del habla y del lenguaje natural, y su actividad se centra en lo que en el sector se conoce como el enfoque centrado en los datos (Data-Centric AI) y la supervisión humana (Human-in-the-Loop).

1. Recolección, preparación y anotación de datos (Data Annotation)

Es su línea de negocio tradicional más consolidada:
  • Datos para entrenamiento de modelos: Generación, recopilación y etiquetado masivo de datos multimodales (texto, audio/voz, imagen y vídeo) para entrenar sistemas de Machine Learning y modelos fundacionales (LLMs).
  • Especialización multilingüe: Cuentan con una amplia red global de anotadores humanos y lingüistas para adaptar datos en cientos de idiomas y dialectos.

2. Evaluación independiente y gobernanza de IA (AI Trust & Safety)

Con la expansión de la IA generativa, la compañía ha evolucionado fuertemente hacia la garantía de calidad y cumplimiento normativo:
  • Auditoría de agentes conversacionales (Sigma Eval): Evaluación externa y continua de agentes de IA en producción frente a alucinaciones, sesgos, toxicidad o manipulación (jailbreaks).
  • Cumplimiento y regulación: Alineación de sistemas de IA con normativas y marcos internacionales como el EU AI Act, las directrices de NIST o normas ISO de IA responsable.

3. Privacidad y anonimización de datos

  • Anonimización multimodal (Sigma Cypher): Herramientas y procesos para detectar, enmascarar o anonimizar información personal identificable (PII) en grandes volúmenes de datos antes de ser procesados o utilizados en el reentrenamiento de modelos.

4. Soluciones de IA a medida (Sigma Cognition)

  • A través de su división de consultoría técnica, desarrollan pruebas de concepto, modelos a medida y proyectos específicos de aprendizaje automático aplicados a procesos corporativos e industriales.
(Nota: en internet suelen convivir bajo los dominios sigma.ai, sigma-ai.com y sigmaaigroup.com; no deben confundirse con la estadounidense Sigma Computing —herramienta de Business Intelligence sobre cloud warehouses— ni con navegadores homónimos).

¿Es española Sigma?

Sí, tiene origen y base operativa en España, aunque opera bajo una estructura corporativa internacional.
  • Fundador y raíces: Su fundador y CEO, el Dr. Daniel Tapias, es un ingeniero de telecomunicaciones e investigador español (doctorado por la Universidad Politécnica de Madrid y exprofesor de la Universidad Autónoma de Madrid).
  • Sede operativa e I+D: Su principal centro de desarrollo y operaciones ha estado históricamente en Madrid (a través de la sociedad Sigma.AI SL), desde donde gestionan gran parte de sus proyectos tecnológicos y lingüísticos.
  • Estructura internacional: Para dar servicio global a grandes clientes tecnológicos y corporativos, la compañía cuenta con presencia en Estados Unidos (con entidad como Sigma AI Group LLC y presencia en San Francisco), además de otros centros internacionales.