Skip to main content
Un experimento mide llamadas de exactamente dos versiones desplegadas de un mismo agente. Tu plataforma de voz enruta a cada persona de forma consistente al lado A o B; Zelto nunca enruta tráfico ni cambia un prompt desplegado. Usa Simulaciones antes del despliegue y Experimentos cuando ambas versiones ya reciban tráfico real. Los experimentos no tienen fecha de finalización automática. Permanecen activos hasta que un operador selecciona Finalizar experimento. Alcanzar un umbral estadístico o completar un lote de evaluación no finaliza el experimento.

Antes del lanzamiento

Las organizaciones piloto tienen acceso completo a Experimentos, incluida la creación por propietarios y administradores, independientemente del plan de pago o la habilitación gradual. Desactivar Pilot restablece los requisitos del plan y de habilitación sin eliminar los experimentos. Los miembros pueden consultarlos, pero no crearlos. Configura el envío de versiones antes del experimento. En LiveKit y cargas propias, envía version en el nivel superior de cada llamada. Conserva el ID del agente entre despliegues y usa etiquetas distintas al cambiar el prompt o pipeline. Comprueba la atribución de las llamadas de ambas versiones; un candidato en borrador no puede ser un lado del experimento. La definición de cada monitor se fija al lanzar el experimento. Las ediciones posteriores no cambian los resultados históricos. Las credenciales siguen siendo operativas: una credencial actual ausente o revocada aparece como fallo de evaluación.
Los monitores de audio no son compatibles con Experimentos porque su proceso de grabación no coincide con la evaluación de transcripciones.

Crear un experimento

  1. Abre Experimentos y selecciona Nuevo experimento.
  2. En Versiones, elige un agente y dos versiones desplegadas. Revisa cambios de prompt, configuración capturada del pipeline y recuentos recientes. Una configuración ausente se muestra como no disponible. Se compara todo el contexto explícito registrado o enviado con versionConfig, incluidas herramientas y flujos. Las capturas antiguas solo incluyen ajustes capturados.
  3. En Monitores, elige las comprobaciones para ambas versiones. Puedes crear un monitor o consultar y editar su configuración en el panel lateral. Usa un grupo guardado o guarda opcionalmente tu selección como grupo reutilizable.
  4. En Revisar, comprueba el tráfico reciente: llamadas elegibles, recuentos A y B y cobertura de identidad. No hace falta un nombre para esta revisión. El tráfico histórico verifica la configuración; no se añade a los resultados del experimento nuevo.
  5. Introduce un nombre y selecciona Lanzar experimento. El nombre es obligatorio al lanzar. Empieza inmediatamente con la hora del servidor; no se puede antedatar ni programar.
Este formulario no incluye filtros de metadatos, selección de identidad, controles de asignación ni ajustes de notificaciones. Tu plataforma sigue siendo responsable del enrutamiento; Zelto observa las versiones indicadas. Si eliges guardar un grupo de monitores, se guarda al lanzar, no al revisar. El experimento conserva una captura de sus monitores; las ediciones o eliminaciones posteriores no la cambian. Los experimentos futuros usan las definiciones vigentes en su lanzamiento. Sigue indicando la versión real en cada llamada futura. Las dos versiones quedan fijas: un tercer despliegue no sustituye un lado. Reutilizar una etiqueta para código modificado mezcla despliegues. Consulta la verificación previa. Crear, editar ajustes, reintentar, concluir y eliminar requiere rol de propietario o administrador. Los miembros pueden consultar los resultados.

Interpretar los resultados

Las llamadas repetidas se agregan primero en una media acotada por persona y resultado. Una persona observada en ambos lados se excluye de la inferencia y se muestra como fuga entre lados. La tabla de resultados muestra medias por persona cuando están disponibles; en caso contrario, usa medias descriptivas por llamada. Las etiquetas estadísticas solo están disponibles cuando:
  • al menos el 95% de las llamadas elegibles tiene identidad estable;
  • la fuga es inferior al 1% de las personas identificables; y
  • ambos lados tienen al menos 50 personas únicas no contaminadas.
En puntos de control predefinidos, Zelto muestra la media de cada lado, el efecto B menos A y un intervalo conservador para revisiones repetidas. Un resultado es Diferencia estadísticamente clara solo si el intervalo excluye cero. Zelto indica qué lado es numéricamente mayor; nunca lo llama “mejor”, declara un ganador general ni recomienda adoptar una versión. Cada resultado es un análisis independiente al 95%, sin ajuste de multiplicidad entre resultados. Sus estados son Recopilando, Diferencia clara, Sin diferencia estadísticamente clara (cuando el operador lo finaliza) y Solo descriptivo. La tabla de llamadas enlaza cada observación con su transcripción e indica si se evaluó, se filtró o falló. Los propietarios y administradores pueden reintentar solo el trabajo ausente o fallido.

Finalizar o editar

Selecciona Finalizar experimento y confirma para cerrar la ventana en ese momento. Las llamadas posteriores ya no entran en la comparación. Las evaluaciones de llamadas anteriores pueden terminar y los resultados siguen disponibles. El experimento no se puede reabrir. Repetir la solicitud conserva la primera hora de finalización. Después del lanzamiento solo pueden cambiar el nombre, la descripción, la asignación esperada y los correos para notificaciones. Las versiones, la cohorte, la identidad y los resultados quedan fijos. Los experimentos del flujo anterior aparecen como Observacional heredado y sus resultados son solo descriptivos, sin las nuevas etiquetas estadísticas por persona. La interfaz no permite cambiar sus versiones o monitores, reabrirlos ni iniciar evaluaciones. Los propietarios y administradores aún pueden editar el nombre, la descripción y las etiquetas de los lados, finalizar una comparación activa o eliminarla.

Reutilizar un grupo mediante la API o MCP

GET /v1/experiments/monitor-groups y la herramienta MCP list_experiment_monitor_groups devuelven los grupos con sus metricIds ordenados. Envía monitorGroupId y esos IDs como outcomeMetricIds al crear un experimento. Para guardar un grupo nuevo al iniciar, envía newMonitorGroupName y los outcomeMetricIds seleccionados. No envíes ambos campos de grupo. El servidor rechaza grupos cuyos miembros ya no coincidan con la selección revisada. El endpoint para finalizar sigue siendo POST /v1/experiments/{id}/conclude, y su herramienta MCP es conclude_experiment.

Experimentos anteriores

Los experimentos creados con el flujo observacional anterior siguen disponibles como comparaciones Observacionales anteriores. Sus resultados son descriptivos y no reciben las nuevas etiquetas estadísticas por usuario. No se pueden cambiar versiones ni monitores, reabrirlos o iniciar evaluaciones. Propietarios y administradores pueden editar nombre, descripción y etiquetas de los grupos, finalizar una comparación activa o eliminarla.

Relacionado