Un sistema de protección por capas
Ninguna protección por sí sola es suficiente frente al uso indebido decidido o adaptativo. En toda la vista previa de GPT‑5.6, usamos protecciones en capas, con configuraciones exactas que varían entre modelos, y las sometemos a pruebas de resistencia frente a ataques del mundo real. Estas incluyen protecciones entrenadas en el modelo, verificaciones en tiempo real durante la generación, señales a nivel de cuenta, acceso diferenciado, monitoreo, aplicación de políticas y pruebas continuas.
GPT‑5.6 está entrenado para rechazar asistencia cibernética prohibida, incluso cuando los usuarios intentan ocultar su intención o hacer jailbreak al modelo. Estas protecciones a nivel de modelo establecen el primer límite alrededor de aquello con lo que el modelo debe y no debe ayudar.
Los clasificadores de uso indebido en ciberseguridad y biología en tiempo real aportan otra capa al evaluar la salida a medida que se genera. En casos de mayor riesgo, si detectan una posible infracción, la generación puede pausarse mientras un modelo de razonamiento más grande revisa la conversación y su contexto. Si la salida se evalúa como no permitida, se retiene antes de que llegue al usuario.
La actividad marcada también puede activar una revisión a nivel de cuenta en conversaciones y señales de riesgo relevantes, de acuerdo con nuestros términos y políticas sobre retención y revisión de contenido. Mirar más allá de una sola conversación ayuda a nuestros sistemas a distinguir el comportamiento malicioso persistente del trabajo legítimo de seguridad de doble uso, donde conceptos técnicos similares pueden aparecer en contextos muy distintos.
En conjunto, estas capas hacen que el enfoque general sea más sólido que cualquier protección por sí sola. El comportamiento del modelo reduce la probabilidad de respuestas dañinas, los sistemas en tiempo real pueden intervenir durante la generación, la revisión a nivel de cuenta puede identificar patrones más amplios y el acceso diferenciado preserva el trabajo defensivo importante sin hacer que las capacidades más sensibles estén disponibles de forma amplia por defecto.
Especialmente durante la vista previa, es posible que los usuarios encuentren protecciones que bloqueen o rechacen algunas solicitudes. Otras solicitudes pueden tardar más porque la generación se pausa para una revisión adicional. Las protecciones pueden intervenir ocasionalmente en trabajos legítimos, en particular en áreas de doble uso donde la actividad defensiva y ofensiva puede parecer similar al inicio.
Eso es parte de lo que la vista previa busca probar. Queremos entender no solo si las protecciones restringen el uso indebido, sino también si los usuarios legítimos pueden completar su trabajo normal de forma confiable y eficiente. Los comentarios durante la vista previa nos ayudarán a reducir bloqueos y demoras innecesarias, mejorar cómo las protecciones interpretan el contexto y crear una experiencia más fluida antes del lanzamiento más amplio.
También estamos trabajando con clientes empresariales en enfoques de más largo plazo —incluida la detección que preserva la privacidad, controles de seguridad operados por el cliente y acceso calibrado según el riesgo de un cliente, usuario o carga de trabajo— para impulsar la seguridad y, al mismo tiempo, respaldar los requisitos de privacidad empresarial.