Así que el concepto está ahí. Es solo que el consumidor es diferente. No es tu sitio web. Es tu usuario a través de una interfaz de chat. Es realmente interesante porque creo que este es un caso donde la tecnología existe y estamos descubriendo los casos de uso para ella a medida que avanza. Muchas gracias por eso. Esas fueron como un montón de preguntas diferentes que voy a agrupar bajo ese tema y luego pasar a las otras.
La siguiente, y hay como este siguiente conjunto de temas, que es todo sobre pruebas. Porque, quiero decir, piensa en los ingenieros. Nos encanta cuando las cosas son deterministas. Todos hemos estado allí cuando estamos tratando de recrear un error o incluso tratando de recrear cosas funcionando, y no está en nuestra máquina. Así que voy a hacer esta pregunta, y hay algunas otras preguntas que estaban relacionadas. ¿Cómo realizarías pruebas de regresión de extremo a extremo en tales aplicaciones? ¿Hay alguna herramienta que usarías? Evitamos pruebas inestables, pero esto parece un caldo de cultivo para pruebas inestables. Y luego, si no vas a usar una herramienta de prueba de extremo a extremo, ¿cómo asegurarías la calidad de la aplicación? Yo diría de la misma manera que pruebas cualquier agente básicamente. Básicamente, solo solicitas la interfaz de usuario de ella y no otra cosa. Así que cosas como evaluación comparativa, evaluación de problemas, y cosas así. Y no la típica prueba de usuario de extremo a extremo que estás probando el LLM y sus capacidades, no la interfaz de usuario en sí.
Esa es una muy buena respuesta también. Y el hecho de que lo estaríamos evaluando de la misma manera que evaluamos otros agentes y la forma en que funcionan. Y esto genera otra pregunta, que es, lo hemos evaluado, estamos haciendo un seguimiento. Notamos que a veces está haciendo lo suyo, se está saliendo de los rieles. ¿Qué medidas de seguridad son necesarias para asegurar una experiencia de usuario adecuada y prevenir que los usuarios hagan algo que no queremos? Y aquí es donde se ramifica en dos, accidentalmente y deliberadamente. Así que, ¿por qué no empezamos con lo accidental, un usuario que está muy inocentemente tratando de trabajar a través de la aplicación. Asegúrate de que sigan caminos aprobados, incluso si están creando su propio camino. Yo diría que puedes tener una colección más grande con componentes predefinidos que hagan más cosas. Por eso incluí la parte del sistema de diseño. Así que puedes darles botones, puedes darles entradas, pero también puedes darles un componente de tarjeta completo que mantendría los pagos reales, para que no se desvíen de eso. Y eso es realmente interesante también porque la siguiente pregunta está muy, muy vinculada a la respuesta, que es, ¿la UI generativa solo puede crear componentes de los que dimos contexto? ¿Cómo evitamos, además de crear componentes con datos que no existen? Así que creo que hablaste un poco sobre darle algo de contexto, aquí hay una tarjeta o aquí hay datos y cómo se conecta a nuestro sistema. Así que puede usar eso. ¿Cómo te aseguras de que va a usar esos en lugar de inventar algo por su cuenta? Creo que la alucinación es un problema común en los LLMs.
Comments