Antes del lanzamiento
Las organizaciones piloto tienen acceso completo a Experimentos, incluida la creación por propietarios y administradores, independientemente del plan de pago o la habilitación gradual. Desactivar Pilot restablece los requisitos del plan y de habilitación sin eliminar los experimentos. Los miembros pueden consultarlos, pero no crearlos. Configura el envío de versiones antes del experimento. En LiveKit y cargas propias, envíaversion en el nivel superior de cada llamada.
Conserva el ID del agente entre despliegues y usa etiquetas distintas al cambiar
el prompt o pipeline. Comprueba la atribución de las llamadas de ambas versiones;
un candidato en borrador no puede ser un lado del experimento.
La definición de cada monitor se fija al lanzar el experimento. Las ediciones
posteriores no cambian los resultados históricos. Las credenciales siguen
siendo operativas: una credencial actual ausente o revocada aparece como fallo
de evaluación.
Crear un experimento
- Abre Experimentos y selecciona Nuevo experimento.
- En Versiones, elige un agente y dos versiones desplegadas. Revisa cambios
de prompt, configuración capturada del pipeline y recuentos recientes.
Una configuración ausente se muestra como no disponible. Se compara todo el
contexto explícito registrado o enviado con
versionConfig, incluidas herramientas y flujos. Las capturas antiguas solo incluyen ajustes capturados. - En Monitores, elige las comprobaciones para ambas versiones. Puedes crear un monitor o consultar y editar su configuración en el panel lateral. Usa un grupo guardado o guarda opcionalmente tu selección como grupo reutilizable.
- En Revisar, comprueba el tráfico reciente: llamadas elegibles, recuentos A y B y cobertura de identidad. No hace falta un nombre para esta revisión. El tráfico histórico verifica la configuración; no se añade a los resultados del experimento nuevo.
- Introduce un nombre y selecciona Lanzar experimento. El nombre es obligatorio al lanzar. Empieza inmediatamente con la hora del servidor; no se puede antedatar ni programar.
Interpretar los resultados
Las llamadas repetidas se agregan primero en una media acotada por persona y resultado. Una persona observada en ambos lados se excluye de la inferencia y se muestra como fuga entre lados. La tabla de resultados muestra medias por persona cuando están disponibles; en caso contrario, usa medias descriptivas por llamada. Las etiquetas estadísticas solo están disponibles cuando:- al menos el 95% de las llamadas elegibles tiene identidad estable;
- la fuga es inferior al 1% de las personas identificables; y
- ambos lados tienen al menos 50 personas únicas no contaminadas.
Finalizar o editar
Selecciona Finalizar experimento y confirma para cerrar la ventana en ese momento. Las llamadas posteriores ya no entran en la comparación. Las evaluaciones de llamadas anteriores pueden terminar y los resultados siguen disponibles. El experimento no se puede reabrir. Repetir la solicitud conserva la primera hora de finalización. Después del lanzamiento solo pueden cambiar el nombre, la descripción, la asignación esperada y los correos para notificaciones. Las versiones, la cohorte, la identidad y los resultados quedan fijos. Los experimentos del flujo anterior aparecen como Observacional heredado y sus resultados son solo descriptivos, sin las nuevas etiquetas estadísticas por persona. La interfaz no permite cambiar sus versiones o monitores, reabrirlos ni iniciar evaluaciones. Los propietarios y administradores aún pueden editar el nombre, la descripción y las etiquetas de los lados, finalizar una comparación activa o eliminarla.Reutilizar un grupo mediante la API o MCP
GET /v1/experiments/monitor-groups y la herramienta MCP
list_experiment_monitor_groups devuelven los grupos con sus metricIds
ordenados. Envía monitorGroupId y esos IDs como outcomeMetricIds al crear
un experimento. Para guardar un grupo nuevo al iniciar, envía
newMonitorGroupName y los outcomeMetricIds seleccionados. No envíes ambos
campos de grupo. El servidor rechaza grupos cuyos miembros ya no coincidan
con la selección revisada.
El endpoint para finalizar sigue siendo POST /v1/experiments/{id}/conclude,
y su herramienta MCP es conclude_experiment.
Experimentos anteriores
Los experimentos creados con el flujo observacional anterior siguen disponibles como comparaciones Observacionales anteriores. Sus resultados son descriptivos y no reciben las nuevas etiquetas estadísticas por usuario. No se pueden cambiar versiones ni monitores, reabrirlos o iniciar evaluaciones. Propietarios y administradores pueden editar nombre, descripción y etiquetas de los grupos, finalizar una comparación activa o eliminarla.Relacionado
- Versiones de agentes — etiquetas, capturas y atribución de llamadas.
- Agentes — versiones desplegadas e historial de llamadas.
- Monitores — resultados disponibles.
- Simulaciones — pruebas controladas antes del despliegue.

