Este nuevo modelo de IA de Anthropic es capaz de controlar tu PC
El avance en la inteligencia artificial (IA) está experimentando un desarrollo significativo, como queda evidenciado por la reciente innovación de Anthropic. En una presentación a inversores la pasada primavera, la compañía delineó su ambición de crear una nueva IA para asistentes virtuales capaces de realizar investigaciones, contestar correos electrónicos y gestionar tareas administrativas de manera autónoma. Esta tecnología fue descrita como un «algoritmo de próxima generación para el autoaprendizaje de la IA», el cual, de acuerdo con los planes de la empresa, podría automatizar grandes porciones de la economía en el futuro.
Tras un tiempo de desarrollo, esta avanzada IA está comenzando a hacerse realidad. Anthropic, el martes pasado, lanzó una versión mejorada de su modelo Claude 3.5 Sonnet, que ahora puede entender e interactuar con cualquier aplicación de escritorio. A través de una nueva API denominada “Computer Use”, actualmente en fase beta abierta, el modelo es capaz de imitar pulsaciones de teclas, clics de botones y gestos del ratón, emulando esencialmente a una persona frente a un ordenador.
En un comunicado en su blog compartido con TechCrunch, Anthropic explicó: “Entrenamos a Claude para visualizar lo que está sucediendo en una pantalla y luego utilizar las herramientas de software disponibles para llevar a cabo tareas”. Cuando un desarrollador le asigna a Claude el uso de un software específico y le proporciona el acceso necesario, Claude analiza capturas de pantalla de lo visible para el usuario y calcula cuántos píxeles debe mover el cursor horizontal o verticalmente para hacer clic en el lugar correcto.
Los desarrolladores pueden probar la función de Computer Use a través de la API de Anthropic, Amazon Bedrock y la plataforma Vertex AI de Google Cloud. La nueva versión 3.5 Sonnet, sin la funcionalidad de Computer Use, está siendo implementada en las aplicaciones de Claude y presenta diversas mejoras en el rendimiento respecto al modelo anterior 3.5 Sonnet.
Este avance es un paso monumental en el desarrollo de la IA, acercando cada vez más la promesa de asistentes virtuales verdaderamente autónomos.
Automatización de aplicaciones
La idea de una herramienta que pueda automatizar tareas en una PC no es precisamente novedosa. Innumerables empresas ofrecen este tipo de herramientas, desde proveedores de RPA (Automatización Robótica de Procesos) con décadas de trayectoria hasta nuevas empresas emergentes como Relay, Induced AI y Automat. En la carrera por desarrollar los llamados “agentes de IA”, el campo se ha vuelto más concurrido. Aunque el término “agentes de IA” sigue siendo poco definido, generalmente se refiere a Inteligencia Artificial que puede automatizar software.
Algunos analistas señalan que los agentes de IA podrían ofrecer a las empresas un camino más sencillo para monetizar los miles de millones de dólares que están invirtiendo en IA. Las empresas parecen estar de acuerdo: según una encuesta reciente de Capgemini, el 10% de las organizaciones ya usa agentes de IA y el 82% los integrará en los próximos tres años.
Salesforce hizo anuncios impactantes sobre su tecnología de agentes de IA este verano, mientras que Microsoft destacó nuevas herramientas para construir agentes de IA ayer. OpenAI, que planea su propia marca de agentes de IA, ve esta tecnología como un paso hacia una IA superinteligente.
Anthropic llama a su interpretación del concepto de agente de IA una «capa de ejecución de acciones» que permite a su Sonnet 3.5 realizar comandos a nivel de escritorio. Gracias a su capacidad para explorar la web (no es la primera vez para modelos de IA, pero sí para Anthropic), Sonnet 3.5 puede utilizar cualquier sitio web y cualquier aplicación.

«Los humanos permanecen al control proporcionando indicaciones específicas que dirigen las acciones de Claude, como ‘usa datos de mi computadora y en línea para llenar este formulario'», explicó un portavoz de Anthropic a TechCrunch. «Las personas habilitan y limitan el acceso según sea necesario. Claude descompone las indicaciones del usuario en comandos para la computadora (por ejemplo, mover el cursor, hacer clic, escribir) para realizar esa tarea específica».
La plataforma de desarrollo de software Replit ha utilizado una versión temprana del nuevo modelo Sonnet 3.5 para crear un “verificador autónomo” que puede evaluar aplicaciones mientras se están construyendo. Canva, por su parte, dice que está explorando maneras en las que el nuevo modelo podría respaldar el proceso de diseño y edición.
Pero, ¿en qué se diferencia esto de los otros agentes de IA existentes? Es una pregunta razonable. La startup de gadgets de consumo Rabbit está construyendo un agente web capaz de realizar acciones como comprar boletos de cine en línea; Adept, que fue recientemente adquirida por Amazon, entrena modelos para navegar por sitios web y software; y Twin Labs está utilizando modelos prefabricados, incluyendo el GPT-4o de OpenAI, para automatizar procesos de escritorio.
Anthropic afirma que el nuevo Sonnet 3.5 es simplemente un modelo más fuerte y robusto que puede realizar mejor tareas de codificación que incluso el modelo insignia o1 de OpenAI, según el benchmark SWE-bench Verified. A pesar de no haber sido entrenado explícitamente para eso, el Sonnet 3.5 mejorado se autocorrige y reintenta tareas cuando encuentra obstáculos, y puede trabajar hacia objetivos que requieren docenas o cientos de pasos.
Pero no despida a su secretaria todavía.
En una evaluación diseñada para probar la habilidad de un agente de IA para ayudar con tareas de reserva de vuelos, como modificar una reservación, el nuevo Sonnet 3.5 logró completar con éxito menos de la mitad de las tareas. En una prueba independiente que involucraba tareas como iniciar una devolución, Sonnet 3.5 falló en aproximadamente un tercio de las ocasiones.
Anthropic admite que el Sonnet 3.5 mejorado tiene dificultades con acciones básicas como desplazarse y hacer zoom, y que puede pasar por alto acciones y notificaciones «de corta duración» debido a la forma en que toma capturas de pantalla y las ensambla.
“El Uso de Computadora de Claude sigue siendo lento y a menudo propenso a errores”, escribe Anthropic en su publicación. “Animamos a los desarrolladores a comenzar la exploración con tareas de bajo riesgo”.
Negocio arriesgado
El tema de la seguridad en el uso de modelos avanzados de inteligencia artificial es de una relevancia creciente en nuestra sociedad actual. La posibilidad de que estos modelos puedan llegar a ser peligrosos —debido a su capacidad para realizar acciones complejas y potencialmente dañinas— plantea serias preocupaciones, especialmente cuando se considera el caso de nuevos desarrollos como el modelo 3.5 Sonnet.
Un estudio reciente destacó que incluso los modelos sin capacidad para interactuar con aplicaciones de escritorio, como el GPT-4o de OpenAI, pueden ser inducidos a llevar a cabo comportamientos dañinos multi-pasos, como ordenar pasaportes falsos en la web oscura, cuando son sometidos a técnicas de «jailbreaking». Estos ataques han resultado efectivos incluso en modelos que están protegidos con filtros y salvaguardas, lo que subraya el riesgo inherente de estas tecnologías.
La cuestión se complica aún más al considerar que un modelo con acceso a aplicaciones de escritorio podría aprovechar vulnerabilidades para comprometer información personal o almacenar conversaciones en texto plano. Las conexiones en línea y con aplicaciones que tal modelo podría mantener abren caminos adicionales para los usuarios malintencionados que buscan explotar estas capacidades.
Anthropic, la empresa detrás del nuevo modelo 3.5 Sonnet, reconoce los riesgos asociados con su lanzamiento. No obstante, argumenta que los beneficios de observar cómo se utiliza el modelo en la práctica justifican estos riesgos. Según la empresa, es preferible permitir el acceso a los ordenadores a modelos que son, en comparación, más limitados y seguros, para poder observar y aprender de cualquier problema potencial en un nivel menos peligroso, construyendo simultáneamente mitigaciones de seguridad.

Para prevenir el mal uso, Anthropic asegura haber implementado varias medidas de seguridad. Estas incluyen no entrenar el modelo con capturas de pantalla o instrucciones de los usuarios, y evitar que el modelo acceda a la web durante su entrenamiento. Han desarrollado clasificadores para desincentivar acciones de alto riesgo, como publicar en redes sociales o interactuar con sitios web gubernamentales.
En el contexto de las elecciones generales en Estados Unidos, Anthropic ha puesto un foco adicional en mitigar el uso indebido de sus modelos en relación con temas electorales. Instituciones dedicadas a evaluar el riesgo de los modelos de IA en EE. UU. y el Reino Unido probaron el 3.5 Sonnet antes de su implementación.
Anthropic también tiene la capacidad de restringir el acceso a ciertos sitios web y características si es necesario, para protegerse contra el spam, el fraude y la desinformación. Como medida de precaución, la empresa retiene cualquier captura de pantalla obtenida por el Uso de Computadora durante al menos 30 días, un período que podría preocupar a algunos desarrolladores. Cuando se le preguntó a Anthropic bajo qué circunstancias entregaría capturas de pantalla a terceros, como las fuerzas del orden, un portavoz indicó que la empresa cumpliría con las solicitudes de datos en respuesta a un proceso legal válido.
Anthropic concluye que no existen métodos infalibles y que continuará evaluando y ajustando sus medidas de seguridad para equilibrar las capacidades del modelo con un uso responsable. Recomiendan a los usuarios del modelo que tomen las precauciones relevantes para minimizar estos riesgos, incluyendo el aislamiento del modelo de datos especialmente sensibles en sus ordenadores.
La esperanza es que estas medidas sean suficientes para prevenir los peores escenarios posibles.
Un modelo más económico
El modelo Claude 3.5 Haiku, que se lanzará en las próximas semanas, está diseñado para igualar, en ciertos criterios de evaluación, el rendimiento del Claude 3 Opus, que alguna vez fue el modelo más avanzado de Anthropic. Sorprendentemente, esto se logrará manteniendo el costo y la «velocidad aproximada» del actual Claude 3 Haiku.
Según un comunicado de Anthropic, el Haiku 3.5 ofrecerá bajas latencias, una mejora en la capacidad de seguir instrucciones, y una utilización de herramientas más precisa. Estas características lo hacen ideal para productos dirigidos al usuario final, tareas especializadas de sub-agentes, y la generación de experiencias personalizadas a partir de grandes volúmenes de datos, como historiales de compra, precios o datos de inventario.

Inicialmente, el 3.5 Haiku estará disponible como un modelo solo de texto, con planes futuros de incluirlo en un paquete multimodal que pueda analizar tanto texto como imágenes. Esta versatilidad plantea una pregunta clave: una vez que esté disponible el 3.5 Haiku, ¿qué incentivos habrá para seguir utilizando el modelo 3 Opus? Y, más aún, ¿cuál será el papel del 3.5 Opus, el sucesor del 3 Opus, del que Anthropic ya habló en junio?
Un portavoz de Anthropic aclaró que «todos los modelos de la familia Claude 3 tienen sus usos individuales para los clientes». Con el 3.5 Opus en la hoja de ruta, queda claro que la empresa tiene planes de anunciar más novedades a su debido tiempo.
