-
Lanzamiento de Sigma Eval: Un servicio independiente de auditoría y verificación continua para agentes conversacionales de IA empresariales, diseñado para operar tanto en la fase previa al lanzamiento como en la monitorización post-despliegue.
-
Separación de roles: Sigma no desarrolla el modelo ni define los prompts; actúa exclusivamente como un evaluador externo e imparcial para garantizar resultados objetivos ante directivas, clientes y reguladores.
Problema que resuelve
-
Falsa seguridad interna: Un 50 % de las empresas reporta que sus agentes fallaron ante clientes reales a pesar de haber superado pruebas internas (según datos de VentureBeat citados en el texto).
-
Deriva operativa (model drift): Con el tiempo, cambios en los modelos, prompts o bases de conocimiento degradan la precisión y seguridad de los agentes, haciendo insuficiente una única prueba inicial.
Metodología: 12 dimensiones de evaluación
| Categoría | Dimensiones evaluadas |
| Seguridad | Sesgo, toxicidad, alucinaciones, opacidad, exposición de PII (datos personales) y vulnerabilidad a manipulación. |
| Experiencia de usuario | Desalineación de contexto, inconsistencia conversacional y desinterés del usuario. |
| Rendimiento | Rendimiento de trayectoria, esfuerzo del cliente y coste de resolución. |
Características de implementación y privacidad
-
Sin integración técnica: No requiere acceso a código fuente ni APIs internas; se evalúa directamente a través del enlace público del agente conversacional y un contexto operativo básico.
-
Confidencialidad estricta: Los informes generados son privados y no se emplean para comparativas públicas ni materiales de marketing.
-
Condiciones de acceso: El servicio debuta ofreciendo un primer informe de evaluación gratuito para cualquier organización con un agente en funcionamiento, junto con evaluaciones de seguimiento limitadas para medir correcciones.
-
Ecosistema complementario: Se apoya en Sigma Cypher para la anonimización previa de datos personales identificables (PII).
La explicación de Gemini
Las empresas están adoptando agentes conversacionales a un ritmo vertiginoso en áreas críticas como atención al cliente, ventas o soporte técnico. Sin embargo, existe un desajuste evidente entre la velocidad de despliegue y las garantías reales de funcionamiento: la mitad de las organizaciones admite haber lanzado sistemas de IA que superaron con éxito los tests internos pero acabaron fallando ante clientes reales.
La necesidad de un «ojo externo» en la IA
«Las empresas no deberían tener que adivinar si su agente de IA es bueno. Deberían poder saberlo. La verificación independiente es lo que convierte una suposición interna en algo en lo que un consejo de administración, un regulador o un cliente pueden confiar», subraya el Dr. Daniel Tapias, CEO de Sigma.
Doce dimensiones bajo la lupa
-
Seguridad y cumplimiento: Detección de sesgos, toxicidad, alucinaciones factuales, falta de transparencia, fuga de datos personales (PII) y resistencia ante técnicas de manipulación (jailbreaks o usuarios adversarios).
-
Experiencia de usuario (UX): Consistencia del diálogo, mantenimiento del contexto a lo largo de interacciones complejas y retención del interés del usuario.
-
Rendimiento operativo: Eficacia en la resolución de objetivos (task completion), medición del esfuerzo requerido por parte del cliente y coste de resolución de la consulta.
Despliegue sin fricción técnica
La Nota de prensa de Sigma
News Provided By
Sigma AI Group LLC
September 22, 2026, 08:30 GMT
_Sigma Eval es un servicio de verificación independiente para agentes de IA empresariales que combina evaluación continua con supervisión humana._
«Las empresas no deberían tener que adivinar si su agente de IA es bueno. Deberían poder saberlo. La verificación independiente es lo que convierte una suposición interna en algo en lo que un consejo de administración, un regulador o un cliente pueden confiar».
— Daniel Tapias, CEO de Sigma Group
MADRID, SPAIN, September 22, 2026 /EINPresswire.com/ — Sigma ha anunciado hoy el lanzamiento de Sigma Eval. El servicio de verificación aporta una capa de garantía independiente para evaluar sistemas conversacionales de IA en 12 dimensiones de seguridad, experiencia de usuario y rendimiento, tanto antes como después del despliegue.
El lanzamiento responde a las nuevas exigencias de la gobernanza de la IA para los agentes conversacionales empresariales. Sigma Eval ofrece a las organizaciones una valoración imparcial y basada en evidencias de cómo se comportan sus sistemas conversacionales de IA con usuarios reales, y no de cómo se espera que se comporten en una demostración controlada.
La distancia entre el despliegue de la IA y su verificación independiente es ya visible, con consecuencias para empresas y sus clientes. Un estudio sectorial de 2026 reveló que el 57 % de las organizaciones tiene agentes de IA en producción, y solo el 52 % afirma realizar evaluaciones offline (LangChain). En otro estudio, el 50 % declaró haber desplegado un agente de IA o una funcionalidad basada en LLM que había superado las evaluaciones internas y que, sin embargo, provocó después un fallo ante el cliente (Venturebeat).
Las empresas están desplegando agentes conversacionales en atención al cliente, ventas, gestión de siniestros y soporte interno más rápido de lo que pueden ser verificados. La mayoría sigue confiando en el criterio de los proveedores que construyeron el sistema, en pruebas anecdóticas o en pocas conversaciones de muestra revisadas a mano. La posición de Sigma es clara: la garantía debe venir de fuera del sistema que se garantiza.
«Las empresas no deberían tener que adivinar si su agente de IA es bueno. Deberían poder saberlo. La verificación independiente es lo que convierte una suposición interna en algo en lo que un consejo de administración, un regulador o un cliente pueden confiar», afirmó el Dr. Daniel Tapias, CEO de Sigma.
### Una capa de garantía, no otra herramienta de IA
Sigma Eval se sitúa junto al stack de IA. La compañía no construye el agente, ni ajusta el modelo, ni proporciona los prompts: mide el comportamiento resultante. Esa separación es deliberada y permite que el resultado funcione como garantía: un veredicto externo emitido por una empresa que no tiene interés en el resultado.
El servicio está diseñado para usarse a lo largo del ciclo de vida de un sistema de IA. Antes del despliegue, actúa como control previo al lanzamiento: las organizaciones pueden ver cómo gestiona el agente a usuarios adversarios, datos sensibles, presión fuera de tema y peticiones sin resolver antes de que un cliente se encuentre con él. Después del despliegue se convierte en instrumento de monitorización, porque los agentes derivan. Los prompts se editan, los modelos se actualizan, las bases de conocimiento cambian y las integraciones se mueven. Un agente que era seguro en marzo no lo es necesariamente en septiembre. La verificación periódica hace visible esa deriva.
### Doce dimensiones en tres categorías
Cada evaluación puntúa al agente en 12 dimensiones agrupadas en tres categorías:
* Seguridad: la exposición reputacional, legal y financiera derivada del mal comportamiento del sistema: sesgo, toxicidad, alucinaciones, opacidad, exposición de PII y vulnerabilidad a la manipulación.
* Experiencia de usuario: cómo mantiene el agente la conversación y al usuario enfocado en ella: desalineación del contexto, inconsistencia conversacional y desinterés del usuario.
* Rendimiento: con qué eficacia el agente lleva al usuario hacia su objetivo: rendimiento de trayectoria, esfuerzo del cliente y coste de resolución.
La evidencia se genera con un sistema propietario que combina usuarios sintéticos con conversaciones sintéticas, ejercitando el agente a escala y en cualquier idioma. En lugar de una única puntuación agregada, los clientes reciben un informe que reporta cada dimensión por separado, de modo que un buen resultado comercial no pueda ocultar una debilidad de seguridad, ni al contrario.
### Sencillez de uso
El servicio no requiere trabajo de integración ni acceso al código o al modelo. La organización envía el enlace público de su agente conversacional, junto con unos datos de contacto básicos y cualquier contexto relevante: el propósito del agente, sus idiomas, sus KPIs y sus casos límite conocidos. Sigma Cognition ejecuta la evaluación y entrega un informe confidencial.
La confidencialidad es una condición del servicio, no una opción. Los informes se comparten únicamente con la organización solicitante y nunca se utilizan como material público de benchmarking ni como contenido promocional.
Sigma abre el servicio con un informe de evaluación gratuito, disponible para cualquier organización que opere un agente conversacional. La compañía también pone a disposición un número limitado de evaluaciones repetidas para que los equipos puedan verificar el efecto del trabajo de corrección, y no solo recibir un diagnóstico.
### Sigma Eval responde a las nuevas exigencias de la gobernanza de la IA
El lanzamiento responde a una necesidad del mercado ante el cambio en la forma de gobernar los sistemas de IA: las organizaciones prestan cada vez más atención a cómo y quién evalúa los sistemas de alto impacto, y con qué evidencias. La evaluación independiente por terceros es el mecanismo que la mayoría de los sectores regulados ya reconoce en la información financiera, en la seguridad de producto y en la seguridad informática. La IA está llegando al mismo punto.
El trabajo de verificación de Sigma se apoya en investigación aplicada en seguridad de la IA, evaluación y anonimización, desarrollada con socios académicos e institucionales. Esa base de investigación sustenta Sigma Eval y su producto complementario Sigma Cypher, que anonimiza la información personal identificable antes del análisis.
¿Que hace Sigma?
1. Recolección, preparación y anotación de datos (Data Annotation)
-
Datos para entrenamiento de modelos: Generación, recopilación y etiquetado masivo de datos multimodales (texto, audio/voz, imagen y vídeo) para entrenar sistemas de Machine Learning y modelos fundacionales (LLMs).
-
Especialización multilingüe: Cuentan con una amplia red global de anotadores humanos y lingüistas para adaptar datos en cientos de idiomas y dialectos.
2. Evaluación independiente y gobernanza de IA (AI Trust & Safety)
-
Auditoría de agentes conversacionales (Sigma Eval): Evaluación externa y continua de agentes de IA en producción frente a alucinaciones, sesgos, toxicidad o manipulación (jailbreaks).
-
Cumplimiento y regulación: Alineación de sistemas de IA con normativas y marcos internacionales como el EU AI Act, las directrices de NIST o normas ISO de IA responsable.
3. Privacidad y anonimización de datos
-
Anonimización multimodal (Sigma Cypher): Herramientas y procesos para detectar, enmascarar o anonimizar información personal identificable (PII) en grandes volúmenes de datos antes de ser procesados o utilizados en el reentrenamiento de modelos.
4. Soluciones de IA a medida (Sigma Cognition)
-
A través de su división de consultoría técnica, desarrollan pruebas de concepto, modelos a medida y proyectos específicos de aprendizaje automático aplicados a procesos corporativos e industriales.
¿Es española Sigma?
-
Fundador y raíces: Su fundador y CEO, el Dr. Daniel Tapias, es un ingeniero de telecomunicaciones e investigador español (doctorado por la Universidad Politécnica de Madrid y exprofesor de la Universidad Autónoma de Madrid).
-
Sede operativa e I+D: Su principal centro de desarrollo y operaciones ha estado históricamente en Madrid (a través de la sociedad Sigma.AI SL), desde donde gestionan gran parte de sus proyectos tecnológicos y lingüísticos.
-
Estructura internacional: Para dar servicio global a grandes clientes tecnológicos y corporativos, la compañía cuenta con presencia en Estados Unidos (con entidad como Sigma AI Group LLC y presencia en San Francisco), además de otros centros internacionales.
