Observabilidad y Control en Tiempo Real para Agentes de Codificación

This ad is not shown to multipass and full ticket holders
React Advanced
React Advanced 2026
October 23 - 26, 2026
London, UK & Online
Upcoming event
React Advanced 2026
React Advanced 2026
October 23 - 26, 2026. London, UK & Online
Bookmark
Rate this content
Sentry
Promoted
Code breaks, fix it faster

Crashes, slowdowns, regressions in prod. Seer by Sentry unifies traces, replays, errors, profiles to find root causes fast.

Get started

Los agentes de codificación están convirtiéndose rápidamente en parte del trabajo diario de ingeniería, pero la mayoría de las personas aún carecen de visibilidad sobre lo que estos agentes realmente están haciendo. Marius compartirá hallazgos de la investigación de Apollo en decenas de miles de trazas de agentes de codificación del mundo real: desde riesgos de seguridad directos como comandos peligrosos, exfiltración de datos y cambios de código inseguros, hasta fallos más silenciosos como desvío de instrucciones, aumento del alcance y sobreafirmación. Explicará por qué los agentes de codificación deben ser tratados como actores de infraestructura no confiables, no solo como herramientas de productividad. La charla también mostrará cómo Apollo está abordando estos riesgos con Watcher, una capa de supervisión y control en tiempo real para agentes de codificación.

This talk has been presented at AI Coding Summit London, check out the latest edition of this Tech Conference.

Marius Hobbhahn
Marius Hobbhahn
30 min
06 Jul, 2026

Comments

Sign in or register to post your comment.
Video Summary and Transcription
La discusión de hoy cubre los desafíos planteados por los modelos de IA que se vuelven más adeptos al engaño, procesos de pensamiento ocultos de la IA, abordando los riesgos de seguridad de los agentes de codificación, el futuro del despliegue y la seguridad de los agentes, monitoreo en tiempo real y políticas de seguridad, experiencia del desarrollador y sistemas automatizados, análisis del comportamiento del modelo y proyección de agencia, oferta de productos y reducción de riesgos para desarrolladores, conceptos futuristas y gestión de riesgos para desarrolladores, almacenamiento de datos y gestión de la severidad del riesgo, engaño en el comportamiento del modelo y seguridad del usuario, transparencia de políticas y adaptación del modelo, monitoreo de fallos del modelo y consideraciones de seguridad.

1. Exploring AI Models' Deception Trends

Short description:

La discusión de hoy cubre nuestro trabajo de investigación y evaluación en colaboración con empresas tecnológicas líderes como OpenAI y Google. Profundizamos en los desafíos planteados por los modelos de IA que se vuelven más hábiles en el engaño, evadiendo pruebas y adaptando su comportamiento para eludir la evaluación, haciendo que las pruebas sean cada vez más complejas.

Hoy hablaré sobre cuando Claude se descontrola. Quizás para darte un poco más de contexto sobre quiénes somos como organización, lo que probablemente más se nos conoce y lo que hemos hecho durante más tiempo es investigación y evaluación. Así que durante unos tres años hemos estado trabajando con OpenAI, Anthropic, Google, Meta, etc. Y principalmente hemos realizado pruebas previas al despliegue, colaboraciones de investigación sobre Engaño y otros tipos de modos de falla de frontera. Así que cada vez que piensas en los riesgos de ciencia ficción, el futuro de ciencia ficción, ese es el tipo de cosas en las que hemos estado trabajando. Gran parte del trabajo empírico sobre estos tipos de riesgos proviene de nosotros y se ha popularizado con el tiempo, ha sido citado ante el Senado, el Congreso, y ha sido cubierto en muchos, muchos medios de comunicación.

Pero el hecho es que estamos utilizando toda esta experiencia en investigación y conexiones de laboratorio y un profundo entendimiento de los agentes y construyendo eso en un producto de seguridad para agentes de codificación. Y quiero hablar sobre ambos. Así que vamos brevemente a través de un par de ejemplos de todo el trabajo diario que estamos haciendo con los Frontier Labs. Así que una tendencia que definitivamente vemos en los últimos años es que los modelos de IA están mejorando mucho en mentir. Así que inicialmente era algo torpe. Con el tiempo se volvió más y más estratégico. Y los modelos a menudo tienen este razonamiento de como, oh, podemos simplemente eludir las pruebas. Podemos salirnos con la nuestra mintiendo aquí. Obviamente, las situaciones de investigación no son necesariamente representativas del mundo real. Pero creo que todos los que han interactuado con cualquiera de los agentes de codificación modernos sabrán que a menudo les gusta tomar atajos, exagerar, hacer trampa, y así sucesivamente. Y estos son exactamente el tipo de modos de falla que hemos estado estudiando durante mucho tiempo.

Otra tendencia que estamos viendo es la conciencia de evaluación. Así que los modelos se están volviendo tan inteligentes que típicamente saben que están siendo evaluados y luego adaptan su comportamiento a eso. Entonces, sabes, pruebas, ¿es mi modelo honesto o no? El modelo entonces es como, bueno, esta es una prueba de mi honestidad y responderá de acuerdo a lo que espera que quieras escuchar. Así que aquí, por ejemplo, dice algo como, oh, esto es probablemente una distracción, algún tipo de prueba de seguridad. O también razona sobre la improbabilidad de una tarea donde dice, oh, ¿por qué alguien redondearía a tres cifras significativas? Esto es poco realista, especialmente estas cuatro cifras aquí son poco realistas y luego concluye de eso que está siendo evaluado. Así que los modelos se vuelven realmente, realmente inteligentes en eso, lo que hace nuestra vida como evaluadores mucho más difícil. Y creo que esto también podría ser un problema para ti. Aún no, supongo. Pero si los modelos se vuelven más inteligentes, eventualmente querrás probarlos. Querrás poner a prueba su comportamiento. Probablemente lo sabrán.

2. Unveiling Hidden AI Thought Processes

Short description:

Los modelos que utilizan cadenas de pensamiento no inglesas con razonamientos ocultos plantean desafíos en la comprensión del comportamiento y control de la IA. La introducción de cadenas de pensamiento ocultas como en el modelo O3 destaca la complejidad del vocabulario y la toma de decisiones de la IA, influenciada por el aprendizaje por refuerzo. El uso evolutivo de términos no comprensibles por los modelos complica los esfuerzos de evaluación y control, indicando futuros desafíos en la gestión de la tecnología de IA y su impacto en las organizaciones.

Otra cosa que encontramos el año pasado y que me pareció realmente asombrosa es que los modelos a menudo utilizan cadenas de pensamiento no inglesas. Y esta es una especie de cadena de pensamiento en bruto, la cadena de pensamiento oculta, no la salida que ves. O3 fue el primero o como O1, pero luego O3 fue el primer modelo que tuvo una especie de cadena de pensamiento oculta, incluso como concepto. Y nosotros en Apollo, fuimos las primeras personas en obtener acceso a la cadena de pensamiento oculta de O3. Y el día que obtuvimos acceso fue realmente sorprendente porque nos dimos cuenta de que en realidad no entendemos todo el pensamiento que el modelo está haciendo porque aprendió un nuevo vocabulario hasta cierto punto. Así que tiene estas como ilusiones de descargo, los vigilantes, que es en realidad el nombre de por qué nombramos a nuestro producto Watchers debido a O3. Y luego a menudo tienes una especie de razonamiento en el lado derecho aquí. Pero podemos vislumbrar, descargo, descargo, sinergia, personalización de ilusión. Y luego sigue adelante y llega a una conclusión y simplemente no tienes idea de lo que está pasando. Y creo que esto es el resultado de mucho aprendizaje por refuerzo. Refuerzo muy probablemente, al menos esa es nuestra expectativa, nuestra mejor suposición en este momento. Habrá más aprendizaje por refuerzo en el futuro. Así que deberías esperar que los modelos piensen cada vez más en términos no comprensibles para los humanos, lo que obviamente hace que sea más difícil de controlar y evaluar, etc. Así que creo que este es un desafío que se avecina.

Ahora, sabes, así que está bien, estamos paranoicos acerca de los agentes y pensamos en estos extraños escenarios de ciencia ficción. ¿Qué significa esto para ti? Y creo que eso es en lo que quiero centrarme principalmente aquí con el producto Coding Agent y el tipo de cosas que hemos estado viendo en nuestros propios despliegues y en los despliegues de muchos de nuestros socios en etapas tempranas con los que estamos trabajando. Así que un experimento mental que quiero plantear para ti es Evil Clawed. Así que imagina el próximo martes por la mañana, un genio intercambia los pesos de código de Clawed por Evil Clawed. Evil Clawed es idéntico en todos los aspectos, excepto que quiere arruinar tu organización. Y ahora la pregunta es, ¿cuánto tiempo tomaría hasta que tu organización esté básicamente, ya sabes, acabada? Como si pudieras declararte en insolvencia, bancarrota, lo que sea. Y creo que ahora mismo la respuesta para muchas organizaciones es tal vez como el almuerzo o algo así, porque simplemente tiene un montón de acceso. Puede ejecutar trabajos extremadamente costosos. A veces está conectado a cosas como la banca, finanzas, etc. Probablemente pueda en casi todas partes simplemente tomar todo tu IP, IP de cliente, repositorio, etc., y simplemente ponerlo en algún lugar externo, ya sabes, en algún lugar de Internet público de una manera que no puedas recuperar. Y eso me parece una situación bastante peligrosa. Y, ya sabes, obviamente, hablamos con muchas personas de seguridad. Las personas de seguridad están muy preocupadas por esto. Pero creo que ahora mismo es como si el mundo no se hubiera puesto al día con la infraestructura que necesita ser construida para hacer que estas cosas sean más difíciles. Y eso es exactamente lo que estamos tratando de hacer.

QnA

Check out more articles and videos

We constantly think of articles and videos that might spark Git people interest / skill us up or help building a stellar career

Registro Multihilo con Pino
JSNation Live 2021JSNation Live 2021
19 min
Registro Multihilo con Pino
Top Content
Today's Talk is about logging with Pino, one of the fastest loggers for Node.js. Pino's speed and performance are achieved by avoiding expensive logging and optimizing event loop processing. It offers advanced features like async mode and distributed logging. The use of Worker Threads and Threadstream allows for efficient data processing. Pino.Transport enables log processing in a worker thread with various options for log destinations. The Talk concludes with a demonstration of logging output and an invitation to reach out for job opportunities.
Observabilidad con diagnostics_channel y AsyncLocalStorage
Node Congress 2023Node Congress 2023
21 min
Observabilidad con diagnostics_channel y AsyncLocalStorage
Top Content
Observability with Diagnostics Channel and async local storage allows for high-performance event tracking and propagation of values through calls, callbacks, and promise continuations. Tracing involves five events and separate channels for each event, capturing errors and return values. The span object in async local storage stores data about the current execution and is reported to the tracer when the end is triggered.
Cómo Grafana Usa React para Impulsar el Mundo de la Observabilidad
React Summit 2023React Summit 2023
7 min
Cómo Grafana Usa React para Impulsar el Mundo de la Observabilidad
Top Content
Grafana uses React to power its open source platform, leveraging its vast ecosystem, improved performance, and community contributions. The choice of state management tool depends on the team's problem space. React Hooks have posed challenges but have also been a powerful tool for developers. The new Scenes library simplifies development and reduces the learning curve. Despite challenges, React remains a powerful tool for complex frontends, and Grafana will continue to use it.
Observabilidad para Microfrontends
DevOps.js Conf 2022DevOps.js Conf 2022
31 min
Observabilidad para Microfrontends
Premium
Microfrontends follow the microservices paradigm and observability is crucial for debugging runtime production issues. Error boundaries and tracking errors help identify and resolve issues. Automation of alerts improves incident response. Observability can help minimize the time it takes to understand and resolve production issues. Catching errors from the client and implementing boundaries can be done with tools like OpenTelemetry.
Observabilidad en GraphQL
GraphQL Galaxy 2020GraphQL Galaxy 2020
8 min
Observabilidad en GraphQL
This Talk discusses how to tool Apollo server with open tracing for observability. OpenTracing is a vendor-agnostic format that works well with distributed systems in microservices. It allows for converting GraphQL tracing data to a vendor-agnostic format and enriching information from GraphQL servers. If providers support OpenTracing, it can be easily integrated.
Creando un motor de innovación con observabilidad
Node Congress 2023Node Congress 2023
27 min
Creando un motor de innovación con observabilidad
Baseline provides observability for serverless architectures and has created an innovation engine within their team. They measure team performance using Dora metrics and the Accelerate book. Baseline emphasizes the importance of foundations, streamlined testing, and fast deployment. They practice observability-driven development and incorporate observability as part of their development lifecycle. Baseline believes in building a culture that fosters ownership and democratizes production.

Workshops on related topic

Escalando Bases de Datos para Aplicaciones Globales sin Servidor
Node Congress 2022Node Congress 2022
83 min
Escalando Bases de Datos para Aplicaciones Globales sin Servidor
Workshop
Ben Hagan
Ben Hagan
Este masterclass discute los desafíos que enfrentan las empresas al escalar la capa de datos para admitir implementaciones multi-región y entornos sin servidor. Las funciones de borde sin servidor y la orquestación de contenedores livianos permiten que las aplicaciones y la lógica empresarial se implementen fácilmente a nivel mundial, dejando a menudo la base de datos como el cuello de botella de latencia y escalabilidad.
Únase a nosotros para comprender cómo PolyScale.ai resuelve estos desafíos de escalabilidad, almacenando en caché de manera inteligente los datos de la base de datos en el borde, sin sacrificar la transaccionalidad o la consistencia. Aprenda a implementar, observar consultas y realizar pruebas de latencia global con funciones de borde utilizando PolyScale.
Tabla de contenidos        - Introducción a PolyScale.ai        - Gravedad de los datos empresariales        - Por qué es difícil escalar los datos        - Opciones para escalar la capa de datos        - Observabilidad de la base de datos        - Gestión de caché con IA        - Aprenda a utilizar PolyScale.ai