El nuevo modelo económico de Anthropic ha mejorado mucho a la hora de ignorar los comandos ocultos
La compañía Anthropic ha presentado el modelo Claude Haiku 5.5, enfocado en tareas rápidas y repetitivas, el cual muestra una mayor capacidad para hallar vulnerabilidades y redactar exploits en comparación con su versión anterior. Se le han asignado medidas de protección en ciberseguridad más estrictas que a la variante previa, aunque con restricciones menos severas que las aplicadas a los modelos más avanzados de la misma familia. En las pruebas de habilidades ofensivas sin las salvaguardas activas, el modelo logró la ejecución de código arbitrario en un pequeño porcentaje de las ejecuciones evaluadas.
En cuanto a la resistencia frente a peticiones maliciosas y técnicas de manipulación como la inyección de prompts, el nuevo modelo ha mejorado considerablemente sus tasas de rechazo frente a su antecesor tanto en la escritura de código como en pruebas de uso de computadora. La empresa señaló que esta versión es la más resistente de su línea Haiku contra órdenes ocultas, igualando en ciertos escenarios el rendimiento de sus modelos principales frente a atacantes adaptativos, aunque todavía presenta ciertas vulnerabilidades en interfaces gráficas.
El modelo presenta un costo menor por token en comparación con el modelo anterior y permite ajustar el esfuerzo para equilibrar inteligencia y precio. Ha sido lanzado en diversas plataformas comerciales y está disponible para los desarrolladores mediante la plataforma de la compañía, acompañado además de modificaciones en los precios de lectura en caché para optimizar los costos de los agentes de inteligencia artificial.