Y tenemos una pregunta más sobre la comparación. Entonces, ¿cómo se compara la exploración autónoma del agente con una suite de regresión curada en términos de los tipos de errores que encuentra? ¿Realmente detecta cosas que una prueba escrita por humanos pasaría por alto? ¿Algo de tu experiencia, Michal?
Sí, creo que esta es realmente una pregunta sobre dogfooding. Cuando hablamos de agentes explorando autónomamente nuestra base de código, queremos darles algunas instrucciones y algo de libertad, pero no demasiada. Entonces, por ejemplo, en un agent device, tenemos una habilidad de dogfooding, que puedes esencialmente pedirle a tu agente que ejecute una sesión de dogfooding con agent device y comenzará a explorar tu aplicación de maneras aleatorias.
Puedes decirle que actúe como un cierto tipo de usuario, por ejemplo, como un Gen Z o millennial o lo que sea. Y en mi experiencia, este tipo de exploraciones están encontrando cosas que los humanos no están detectando, como texto inconsistente, especialmente en aplicaciones internacionalizadas donde algunas cadenas no están correctamente traducidas o algo que encontré en una aplicación fue como una promoción local en alguna tienda local para alguna tienda de comercio.
Así que al acceder a esta tienda, en realidad fui dirigido a algo diferente. Un agente me dijo que este enlace era incorrecto. Debería dirigirme a una ubicación de tienda, pero terminé en un lugar totalmente diferente. Y era como una promoción específica de tiempo en esa tienda, así que solo se mostraría por una semana o algo así. Y la forma en que me gusta ejecutar estos es escribir un buen prompt con algunas instrucciones extensas sobre qué buscar o qué romper, básicamente, o intentar romper y ejecutarlo cada semana o así como una sesión de caza de errores.
Y puedes recompensar a tu agente con ciertas cosas por cierto comportamiento o error encontrado, por ejemplo, para que pueda ser más persistente. O puedes darle un objetivo si estás usando un code code o codex harnesses, y puedes usarlos fácilmente incluso con tu agente personalizado. Así que, por ejemplo, ahora AISDK7 soporta el uso de Cloud Code, Codex y algunos otros harnesses para que no necesites crear el tuyo propio con tus propias llamadas de herramientas, etc. Así que es bastante genial. Realmente recomiendo simplemente jugar con ello.
Así que, como con cualquier cosa con IA, es muy fácil comenzar y luego toma un largo tiempo simplemente jugar con pequeños cambios de redacción. Lo bueno es que puedes delegar esto a la IA si eres bueno estableciendo metas y límites alrededor de ello. Muchas gracias por una respuesta tan detallada. Quiero decir, solo estoy pensando, ¿cómo podemos recompensar a los agentes? ¿Qué tipo de recompensa prefieren? Como más tokens, tokens más sabrosos, algo así. Muchas gracias, Michal. Fue un gran placer ver tu sesión y tener esta breve conversación. Mantengámonos conectados y mantengámonos conectados todos. Adiós, Michal. Gracias. Que tengas un buen día.
Comments