mlx-serve

IA / ML

Descripción

Licencia MIT y descarga gratuita: el requisito es un Mac con Apple Silicon y macOS 26.2 o posterior. El servidor nativo, escrito en Zig, expone los modelos en localhost:11234 sin Python, sin Electron y sin enviar datos a la nube.

Las APIs compatibles con OpenAI, Anthropic y Ollama permiten apuntar Claude Code, Cursor, Continue, Open WebUI o el SDK de OpenAI al mismo endpoint. Sirve pesos MLX y cualquier GGUF de Hugging Face; en la misma instancia genera imagen, vídeo, música, voz con clonación y modelos 3D sobre MLX.

App de menús y CLI

  • MLX Core: aplicación firmada y notariada en la barra de menús para descargar modelos, chatear, modo agente con herramientas MCP y ajustar el servidor.
  • CLI al estilo Ollama (run, pull, list, serve) e instalación por Homebrew.
  • Decodificación un 26 % más rápida que LM Studio con los mismos pesos MLX; batching continuo, cuantización de KV-cache y decodificación especulativa.

Tecnologías y temas

  • API OpenAI y Anthropic

    El mismo localhost sirve a Claude Code, Cursor y el SDK de OpenAI

  • MLX Core

    App de barra de menús con chat, agente MCP y gestión de modelos

  • MLX y GGUF

    Modelos nativos de Apple Silicon y GGUF de Hugging Face

  • Multimodal

    Imagen, vídeo, música, clonación de voz y 3D en el mismo proceso

  • Sin Python

    Binario Zig; +26 % de decodificación frente a LM Studio en pesos MLX idénticos