Mistral AI ha introducido Shieldstral, un modelo de inteligencia artificial de 3 mil millones de parámetros, concebido para asistir a los desarrolladores en la evaluación de la pertinencia de texto, imágenes y respuestas generadas por IA. Este modelo opera como un clasificador de seguridad, diferenciándose de los chatbots de propósito general. Su función primordial radica en analizar el contenido conforme a un conjunto de reglas preestablecidas, para determinar si este debe ser permitido, bloqueado o sometido a revisión.
Shieldstral se presenta como un modelo de código abierto, adaptable a políticas específicas y multimodal, lanzado bajo la licencia Apache 2.0. Esta licencia concede a los desarrolladores la libertad de personalizar y desplegar el modelo según sus requerimientos particulares.
La Necesidad de Flexibilidad en la Seguridad de la IA
Los productos de IA contemporáneos requieren de salvaguardias, sistemas capaces de identificar contenido dañino, inapropiado o que infrinja las políticas antes de que llegue a los usuarios finales. No obstante, las normativas de seguridad varían considerablemente entre distintas aplicaciones.
Por ejemplo, una plataforma de ciberseguridad podría requerir la discusión detallada de investigaciones sobre malware, mientras que un chatbot de consumo podría restringir contenido similar. Herramientas educativas, plataformas de salud y aplicaciones de generación de imágenes poseen requisitos de moderación divergentes.
Los modelos de moderación tradicionales suelen depender de reglas fijas incorporadas durante la fase de entrenamiento del sistema. Si las políticas experimentan cambios, los desarrolladores podrían verse obligados a reentrenar o modificar sustancialmente el modelo. Shieldstral propone un enfoque distinto: los desarrolladores pueden proporcionar políticas de seguridad en lenguaje natural mientras el modelo está en ejecución. Esto implica que un único modelo puede adaptarse a diversos productos y casos de uso sin necesidad de un reentrenamiento.
Transformando la Moderación en una Decisión Binaria
Shieldstral evalúa el contenido al enmarcar la moderación como una decisión sencilla de sí o no. Cada solicitud comprende tres elementos:
- Una instrucción que explica el contexto.
- Una pregunta de seguridad específica.
- El contenido objeto de evaluación.
El contenido puede incluir texto, respuestas generadas por IA, combinaciones de indicaciones y respuestas, o imágenes acompañadas de texto. En lugar de generar explicaciones extensas, el modelo produce una puntuación de probabilidad que indica si el contenido cumple con una política determinada. Los desarrolladores pueden entonces establecer sus propios umbrales, decidiendo el nivel de estrictez de la moderación. Esto permite a las empresas aplicar reglas más rigurosas en entornos sensibles, manteniendo una mayor flexibilidad para investigaciones o aplicaciones especializadas.
Diseñado para Texto, Imágenes y Eficiencia
Una de las fortalezas clave de Shieldstral reside en su capacidad multimodal, lo que le permite evaluar texto, imágenes o combinaciones de ambos a través de un sistema unificado. Esta característica es cada vez más relevante a medida que las aplicaciones de IA trascienden el texto para procesar fotografías, capturas de pantalla, documentos y contenido visual generado por usuarios.
Mistral afirma que Shieldstral ofrece un rendimiento comparable, o superior, al de algunos modelos de seguridad de código abierto hasta siete veces más grandes en áreas como la moderación de texto, la detección de rechazos y la adaptabilidad a políticas. A pesar de estas capacidades, el modelo es lo suficientemente ligero como para ejecutarse en una única GPU NVIDIA de 16 GB, lo que lo hace más accesible y económico para los desarrolladores.
Una Nueva Dirección para la Seguridad en la IA
Al liberar Shieldstral como software de código abierto bajo la licencia Apache 2.0, Mistral proporciona a los desarrolladores una herramienta flexible para construir aplicaciones de IA más seguras. El mensaje subyacente es que la seguridad de la IA podría no depender exclusivamente de modelos cada vez más grandes. Sistemas más pequeños y especializados, capaces de comprender el contexto y aplicar políticas de manera eficiente, podrían constituir un componente esencial en los futuros productos de inteligencia artificial.