White Circle lanzó Halo 1.0 el 2026-09-21 y abrió el marco de entrenamiento y postentrenamiento que utiliza para sus propios modelos.
En la publicación de lanzamiento de Halo, la empresa describe Halo como una capa distribuida para flujos de modelos de Hugging Face que mantiene los checkpoints estándar de SafeTensors. Los métodos compatibles incluyen ajuste fino supervisado, entrenamiento por preferencias, modelado de recompensas, GRPO y destilación. Halo también admite aprendizaje por refuerzo asíncrono con rollouts de SGLang o vLLM, además de uso de herramientas en sandbox durante el entrenamiento.
Esto ofrece a los equipos que ya trabajan con Hugging Face una forma de ampliar el postentrenamiento multinodo sin migrar a un stack más pesado ni cambiar los formatos de checkpoint.
Aun así, hay consideraciones. RuntimeWire indica que los resultados de benchmark publicados proceden de las propias pruebas de White Circle y pueden variar según la carga de trabajo. También informa de términos de licencia complementarios que añaden condiciones para usuarios comerciales de mayor tamaño, por lo que la revisión legal puede ser tan importante como la validación de benchmarks.
