Oh, en realidad, ¿puedo pedirte que hables en este micrófono para nuestros asistentes remotos? Ya mencionaste sobre los costos de ejecución local, pero me pregunto en tu experiencia con estos modelos, ¿hubo alguno que fuera el mejor en términos de costo al ejecutarse localmente o, digamos, en un servicio de terceros como AWS, por ejemplo? Correcto. Desafortunadamente, no profundicé en eso. Así que, estaba usando modelos tal cual en código en la nube. Como, típicamente, no lo hice, como dije, intenté localmente, no me funcionó bien, y decidí no seguir ese camino por ahora. Tal vez ese sea el siguiente paso, pero, de nuevo, los primeros experimentos simplemente me desanimaron lo suficiente, al menos por ahora. Quiero decir, pregúntame en un mes, todo puede cambiar. Las cosas cambian tan rápido por aquí.
Así que, siguiente pregunta. Dijiste que el harness es más importante. ¿Puedes contarnos más sobre tu configuración? Bueno, mi configuración para el canal de YouTube está por todos lados, en realidad, porque depende de lo que pruebo y cómo, pero lo que estoy diciendo aquí, por ejemplo, el código en la nube funciona mejor, los modelos en la nube funcionan mejor en código en la nube que en código abierto, por ejemplo, y viceversa. Así que, no solo necesitas pensar en el modelo que ejecutas, sino dónde lo estás ejecutando. Así que, el harness, la definición de harness es tan vaga, pero me gusta una de las definiciones. Dice, como, el harness es todo excepto el modelo. Así que, el IDE, las habilidades que mencionaste, el prompt, los guardrails, las evaluaciones, todo eso. Así que, esto es a lo que me refiero como harness en general, y no hay, como, un gran secreto. De nuevo, depende de con qué tecnología estás trabajando, como React u otro lenguaje, así que probablemente el harness debería tener habilidades y guardrails alrededor de ese lenguaje específico, y eso daría mejores resultados que solo usar el modelo en sí. Increíble.
Siguiente pregunta. ¿Qué metodología recomendarías para medir la efectividad de usar LLMs para resolver un problema o realizar una tarea versus la automatización determinista y los procesos manuales? Creo que Mario habló sobre eso en algunas preguntas, así que, ¿cómo evalúas, como, el LLM, que evalúa el LLM, y no hay una respuesta definitiva, y por eso decidí mi metodología de pruebas automatizadas, porque creo que así encontré mi nicho en los canales de YouTube, así que la gente aprecia que mire el código en absoluto, porque algunos, como, videos de LLM en YouTube, como, oh, hay un nuevo modelo. Vamos a probarlo de una vez, y yay, funciona, y es la próxima gran cosa. Así que, ese es usualmente el típico YouTuber, Hype Bro los llamo. Así que, por eso estoy mirando el código y mi prueba determinista. Creo en esas porque creo que muestran escenarios más realistas para las personas que quieren preocuparse por la calidad del código y todos los casos extremos, y todos estamos ejecutando y escribiendo pruebas automatizadas de todos modos, así que este debería ser el benchmark, al menos por ahora, para tareas básicas. De nuevo, estamos hablando de tareas bastante simples como crear un CRUD, crear API, crear algo, así que para mis tareas, creo que el benchmark determinista con prueba automatizada es el mejor por ahora, pero por supuesto, a medida que llegamos a evaluar Fable u Opus High, no tengo la respuesta aún de cómo podemos evaluar si funciona bien porque es realmente difícil incluso revisar, así que si Opus te da, como, una pull request para revisar, como, 200 archivos cambiados, ¿cómo lo revisas incluso, como, a nivel humano? Así que, no tengo la respuesta de cómo evaluamos ese nivel de LLMs. Nos queda un minuto más, así que solo haremos esta última pregunta.
Comments