Por cierto, gracias, amigos, por enviar sus preguntas. Sí, realmente quiero que este evento sea como una conversación bidireccional. ¿Tenemos evaluaciones para garantizar la calidad de las salidas? Sí, tal vez vamos a generalizar. ¿Cuál es tu enfoque para establecer el estándar y seguir el estándar de calidad en las respuestas del modelo? Así que lo primero es que el modelo debería haberme dado la respuesta que quiero, esa es la calidad que esperaría sin ningún error. Y anteriormente, no tenía evaluaciones. Pero lentamente, lo que estoy tratando de construir se basa en las analíticas, estoy tratando de entender cómo estos modelos funcionan y entender más sobre, no sobre qué tan bien funcionan, sino más sobre cuántos errores estoy obteniendo. Así que, por ejemplo, en el propio CLI, el problema que estaba enfrentando era que el modelo no llamaría al comando exacto que querría y trataría de asumir cosas. Así que ese era el error que estaba tratando de perseguir, y así es como llegué a la conclusión de que los modelos de codecs versus modelos de cloud, cloud tenía un 2x, el error, dando 2x errores que lo que codecs tenía basado en milésimas o diezmilésimas de salida. Así que para mí, me di cuenta, está bien, los modelos de codecs son mucho mejores, pero porque la mitad de mis usuarios o desarrolladores usan cloud, todavía usan cloud, así que tendría que mejorar el CLI en esto. Y luego, sobre esa base, tenía una automatización que se enfoca específicamente o pide a los modelos de cloud que automaticen o creen una automatización cada día para revisar las analíticas y luego mejorar. Así que ese es mi conjunto de evaluaciones que construí.
Genial. Así que, también una especie de bucle de meta IA, ¿verdad? Sí. Así que la IA sigue y mejora la IA. Y, quiero decir, mi opinión personal sobre la misma pregunta es, si hay una oportunidad de proporcionar cualquier verificación determinística, evolución, como quieras llamarlo, ve por eso. Quiero decir, la evaluación basada en IA es el último recurso, ¿verdad? Por supuesto, en muchos casos, solo puede ser impulsada por IA, pero si puedes simplemente conectar un viejo algoritmo determinístico dorado, si lo deseas, evaluación, es la opción más simple. Y lo mismo para el enfoque, cómo uso herramientas de codificación de IA. Intento instrumentar tanto como sea posible puertas determinísticas, porque eso ayuda a ahorrar tokens, cuesta dinero, tiempo, esfuerzos y todo. Sí, y tomemos el siguiente. Eso es muy interesante, por cierto, y también plantea una gran pregunta abierta. Permíteme también generalizar esto un poco. ¿Hay alguna tarea que tal vez intentaste automatizar con IA, pero fallaste o tal vez incluso no intentaste automatizar con IA? Entonces, donde nuestro juicio sigue siendo la única forma de avanzar. ¿Alguna tarea, alguna experiencia como esa? Creo que no. No puedo pensar en algo en el lado del CLI, pero al menos en el trabajo, lo que me di cuenta, porque no puedo escribir mucho código sobre cómo trabajé en el CLI, porque hay mucho dinero involucrado. Así que, trabajo en la publicación de la app store, así que cualquier pequeño error que cometa afectará a miles de desarrolladores en una hora, así que tengo que ser muy cuidadoso con eso, y ahí es donde el juicio humano es muy insustituible. Así que, tengo una automatización donde vería los errores de la app store, y luego ejecutaría nuestro bot RORC. Así que, trabajo en RORC, así que tendría un bot que se ejecutaría en los problemas, pero a veces, incluso después de darle tanto contexto como sea posible, la base de código, e incluso mis gráficos locales de codex, he encontrado que no sería capaz de señalar el problema exacto donde querría que estuviera. Tal vez, ahora mismo, los últimos modelos GVT no están en ese punto donde creo que tal vez es un problema de habilidad de mi parte, donde no he podido escribir suficientes habilidades, juego de palabras intencionado. Pero la idea principal es que siento que en este punto, hay muchos lugares donde intenté la automatización, y especialmente esta tubería donde tomaría los errores que obtengo de los usuarios, y trataría de automatizarlo hasta un punto donde pueda decir con confianza que este PR que se ha generado es algo que puedo fusionar autónomamente en la base de código de producción. Así que, todavía soy un humano en el bucle en este momento.
Comments