> ## Documentation Index
> Fetch the complete documentation index at: https://docs.zelto.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Experimentos

> Compara versiones desplegadas de agentes mediante resultados de monitores independientes.

Un **experimento** mide llamadas de exactamente dos versiones
desplegadas de un mismo agente. Tu plataforma de voz enruta a cada persona de
forma consistente al lado A o B; Zelto nunca enruta tráfico ni cambia un prompt
desplegado.

Usa [Simulaciones](/es/docs/simulations) antes del despliegue y Experimentos
cuando ambas versiones ya reciban tráfico real.

Los experimentos **no tienen fecha de finalización automática**. Permanecen
activos hasta que un operador selecciona **Finalizar experimento**. Alcanzar un
umbral estadístico o completar un lote de evaluación no finaliza el experimento.

## Antes del lanzamiento

Las organizaciones piloto tienen acceso completo a Experimentos, incluida la
creación por propietarios y administradores, independientemente del plan de pago
o la habilitación gradual. Desactivar Pilot restablece los requisitos del plan y
de habilitación sin eliminar los experimentos. Los miembros pueden consultarlos,
pero no crearlos.

Configura el [envío de versiones](/es/docs/agent-versions) antes del experimento.
En LiveKit y cargas propias, envía `version` en el nivel superior de cada llamada.
Conserva el ID del agente entre despliegues y usa etiquetas distintas al cambiar
el prompt o pipeline. Comprueba la atribución de las llamadas de ambas versiones;
un candidato en borrador no puede ser un lado del experimento.

| Parte | Qué significa |
| - | - |
| **Agente y versiones** | Dos versiones desplegadas del mismo agente, una por lado. Pueden cambiar el prompt, pipeline o ambos. |
| **Identidad** | El formulario usa ID de usuario final con respaldo del ID de receptor. Envía un `endUserId` estable cuando esté disponible y enruta consistentemente en tu plataforma. |
| **Monitores** | Uno o más monitores de transcripción configurados, aplicados a cada llamada elegible de ambos lados, independientemente de su estado o muestreo actual. Un grupo guardado es opcional. |

La definición de cada monitor se fija al lanzar el experimento. Las ediciones
posteriores no cambian los resultados históricos. Las credenciales siguen
siendo operativas: una credencial actual ausente o revocada aparece como fallo
de evaluación.

<Warning>
  Los monitores de audio no son compatibles con Experimentos porque su proceso de
  grabación no coincide con la evaluación de transcripciones.
</Warning>

## Crear un experimento

1. Abre **Experimentos** y selecciona **Nuevo experimento**.
2. En **Versiones**, elige un agente y dos versiones desplegadas. Revisa cambios
   de prompt, configuración capturada del pipeline y recuentos recientes.
   Una configuración ausente se muestra como no disponible. Se compara todo el
   contexto explícito registrado o enviado con `versionConfig`, incluidas
   herramientas y flujos. Las capturas antiguas solo incluyen ajustes capturados.
3. En **Monitores**, elige las comprobaciones para ambas versiones. Puedes crear
   un monitor o consultar y editar su configuración en el panel lateral. Usa un
   grupo guardado o guarda opcionalmente tu selección como grupo reutilizable.
4. En **Revisar**, comprueba el tráfico reciente: llamadas elegibles, recuentos
   A y B y cobertura de identidad. No hace falta un nombre para esta revisión.
   El tráfico histórico verifica la configuración; no se añade a los resultados
   del experimento nuevo.
5. Introduce un nombre y selecciona **Lanzar experimento**. El nombre es
   obligatorio al lanzar. Empieza inmediatamente con la hora del servidor;
   no se puede antedatar ni programar.

Este formulario no incluye filtros de metadatos, selección de identidad,
controles de asignación ni ajustes de notificaciones. Tu plataforma sigue
siendo responsable del enrutamiento; Zelto observa las versiones indicadas.

Si eliges guardar un grupo de monitores, se guarda al lanzar, no al revisar.
El experimento conserva una captura de sus monitores; las ediciones o
eliminaciones posteriores no la cambian. Los experimentos futuros usan las
definiciones vigentes en su lanzamiento.

Sigue indicando la versión real en cada llamada futura. Las dos versiones
quedan fijas: un tercer despliegue no sustituye un lado. Reutilizar una etiqueta
para código modificado mezcla despliegues. Consulta la
[verificación previa](/es/docs/agent-versions#verificar-antes-de-lanzar-un-experimento).

Crear, editar ajustes, reintentar, concluir y eliminar requiere rol de
propietario o administrador. Los miembros pueden consultar los resultados.

## Interpretar los resultados

Las llamadas repetidas se agregan primero en una media acotada por persona y
resultado. Una persona observada en ambos lados se excluye de la inferencia y se
muestra como **fuga entre lados**. La tabla de resultados muestra medias por
persona cuando están disponibles; en caso contrario, usa medias descriptivas
por llamada.

Las etiquetas estadísticas solo están disponibles cuando:

* al menos el 95% de las llamadas elegibles tiene identidad estable;
* la fuga es inferior al 1% de las personas identificables; y
* ambos lados tienen al menos 50 personas únicas no contaminadas.

En puntos de control predefinidos, Zelto muestra la media de cada lado, el efecto
B menos A y un intervalo conservador para revisiones repetidas. Un resultado es
**Diferencia estadísticamente clara** solo si el intervalo excluye cero. Zelto
indica qué lado es numéricamente mayor; nunca lo llama “mejor”, declara un
ganador general ni recomienda adoptar una versión.

Cada resultado es un análisis independiente al 95%, sin ajuste de multiplicidad
entre resultados. Sus estados son **Recopilando**, **Diferencia clara**,
**Sin diferencia estadísticamente clara** (cuando el operador lo finaliza) y
**Solo descriptivo**.

La tabla de llamadas enlaza cada observación con su transcripción e indica si se
evaluó, se filtró o falló. Los propietarios y administradores pueden reintentar
solo el trabajo ausente o fallido.

## Finalizar o editar

Selecciona **Finalizar experimento** y confirma para cerrar la ventana en ese
momento. Las llamadas posteriores ya no entran en la comparación. Las evaluaciones
de llamadas anteriores pueden terminar y los resultados siguen disponibles.
El experimento no se puede reabrir. Repetir la solicitud conserva la primera hora
de finalización.

Después del lanzamiento solo pueden cambiar el nombre, la descripción,
la asignación esperada y los correos para notificaciones.
Las versiones, la cohorte, la identidad y los resultados quedan fijos.

Los experimentos del flujo anterior aparecen como **Observacional heredado** y
sus resultados son solo descriptivos, sin las nuevas etiquetas estadísticas por
persona. La interfaz no permite cambiar sus versiones o monitores, reabrirlos
ni iniciar evaluaciones. Los propietarios y administradores aún pueden editar
el nombre, la descripción y las etiquetas de los lados, finalizar una
comparación activa o eliminarla.

## Reutilizar un grupo mediante la API o MCP

`GET /v1/experiments/monitor-groups` y la herramienta MCP
`list_experiment_monitor_groups` devuelven los grupos con sus `metricIds`
ordenados. Envía `monitorGroupId` y esos IDs como `outcomeMetricIds` al crear
un experimento. Para guardar un grupo nuevo al iniciar, envía
`newMonitorGroupName` y los `outcomeMetricIds` seleccionados. No envíes ambos
campos de grupo. El servidor rechaza grupos cuyos miembros ya no coincidan
con la selección revisada.

El endpoint para finalizar sigue siendo `POST /v1/experiments/{id}/conclude`,
y su herramienta MCP es `conclude_experiment`.

## Experimentos anteriores

Los experimentos creados con el flujo observacional anterior siguen disponibles
como comparaciones **Observacionales anteriores**. Sus resultados son descriptivos
y no reciben las nuevas etiquetas estadísticas por usuario. No se pueden cambiar
versiones ni monitores, reabrirlos o iniciar evaluaciones. Propietarios y
administradores pueden editar nombre, descripción y etiquetas de los grupos,
finalizar una comparación activa o eliminarla.

## Relacionado

* [Versiones de agentes](/es/docs/agent-versions) — etiquetas, capturas y atribución de llamadas.
* [Agentes](/es/docs/agents) — versiones desplegadas e historial de llamadas.
* [Monitores](/es/docs/monitors) — resultados disponibles.
* [Simulaciones](/es/docs/simulations) — pruebas controladas antes del despliegue.
