Mejorar la solidez con red teaming automatizado
Las protecciones también deben seguir siendo eficaces cuando los atacantes adaptan sus tácticas. Una protección que solo funciona con un conjunto fijo de ataques conocidos no es lo suficientemente sólida para un modelo de vanguardia.
Por eso aplicamos más inteligencia y capacidad de cómputo que nunca a la seguridad. Usamos nuestros propios modelos para encontrar debilidades y reforzar las protecciones con mayor rapidez. Dedicamos más de 700 000 horas de GPU equivalentes a A100 al red teaming automatizado para encontrar jailbreaks universales: ataques que pueden funcionar con muchos prompts o en distintos contextos, no solo en un entorno limitado. Centrarnos en estos ataques más difíciles y generales nos permitió poner a prueba las protecciones más allá de un conjunto fijo de fallas conocidas. También nos permite explorar muchos más patrones de ataque de los que podrían abarcar las pruebas realizadas únicamente por personas, identificar patrones de falla con mayor anticipación y acortar el tiempo entre detectar una debilidad y corregirla.
Además del red teaming automatizado, trabajamos con evaluadores externos para realizar un red teaming exhaustivo con expertos humanos, que continuará durante el período de vista previa. El red teaming humano complementa el trabajo automatizado al probar las protecciones frente a expertos creativos que intentan hacer un uso indebido del modelo de maneras que nuestros sistemas quizá no anticipen.
Ninguna evaluación puede representar todas las configuraciones de producto, los ataques de varios pasos o los flujos de trabajo del mundo real. Por eso mantenemos un proceso de respuesta rápida para reproducir, evaluar, priorizar y remediar los jailbreaks recién descubiertos, y luego agregarlos a nuestras evaluaciones continuas para poder probar fallas similares en el futuro.