White Circle a publié Halo 1.0 le 2026-09-21, en ouvrant le framework d'entraînement et de post-entraînement qu'elle utilise pour ses propres modèles.
Dans le billet de lancement de Halo, l'entreprise présente Halo comme une couche distribuée pour les workflows de modèles Hugging Face, qui conserve les checkpoints SafeTensors standard. Les méthodes prises en charge incluent le fine-tuning supervisé, l'entraînement par préférences, la modélisation de récompense, GRPO et la distillation. Halo prend aussi en charge l'apprentissage par renforcement asynchrone avec des rollouts SGLang ou vLLM, ainsi que l'utilisation d'outils en bac à sable pendant l'entraînement.
Les équipes déjà organisées autour de Hugging Face peuvent ainsi étendre leur post-entraînement à plusieurs nœuds sans passer à une stack plus lourde ni modifier les formats de checkpoints.
Des réserves subsistent. RuntimeWire indique que les résultats de benchmark publiés proviennent des propres tests de White Circle et peuvent varier selon les charges de travail. Le média mentionne également des conditions de licence complémentaires qui ajoutent des exigences pour les grands utilisateurs commerciaux : une revue juridique peut donc compter autant que la validation des benchmarks.
