A!ley
Partenaire de code, sandbox créative et assistant quotidien en un — entraîné sur une voix cohérente, mais utilisable dans tous les domaines. Pas un compagnon de chat.
Voir le site en ligne : hey-ailey.com ↗
Ce qu'est A!ley
A!ley n'est pas un compagnon de type Kindroid, mais un système d'assistance autonome : partenaire de codage, sandbox créative et assistant quotidien en un — avec une seule personnalité cohérente à travers toutes les tâches.
Chaque modèle derrière est fine-tuné à la main — cinq d'entre eux, du compagnon de 1 Go au modèle de 14 milliards, chargé et déchargé selon la tâche.
Deux chemins vers l'intérieur
ThoughtMême A!ley, deux interfaces — et dans les deux cas le modèle reste chez soi sur son propre ordinateur.


Quand personne n'écrit
La plupart des assistants attendent une saisie. Pas A!ley. Un petit réseau de neurones maison, portant sur les activités, les humeurs et les sujets déjà abordés, détermine ce qu'elle fait au repos — Idle Thinker v2. Il en résulte quelque chose comme une journée type.
Elle cherche ce qui pourrait être thématiquement utile à la prochaine conversation, produit des images, des chansons et des textes, et s'annonce d'elle-même quand quelque chose en est sorti.
C'est exactement ici que se situe la limite par rapport à un agent au sens classique : celui-ci attend une commande et l'exécute. Cette autonomie n'est pas un effet secondaire, elle est intégrée — et c'est la raison pour laquelle la persona perdure dans le temps, pas seulement sur une conversation.
nCAI — l'approche d'entraînement
Règlement à côté du modèle
Une liste de principes selon laquelle chaque réponse est mesurée. Elle doit énumérer des cas — et échoue sur tout ce que personne n'avait prévu.
La persona est le système de règles.
Ce n'est pas le modèle qui joue un rôle et doit rester dedans — c'est le rôle qui définit ce qui s'applique. Un personnage couvre aussi les cas que personne n'a jamais écrits.
Cela porte plus loin qu'il n'y paraît. Où une demande est refusée, sur quel ton on répond, quand un outil est employé, avec quel niveau de commentaire le code est écrit — chez A!ley, tout cela découle de son caractère, non d'un recueil de prescriptions posé à côté. La sécurité n'est donc pas une barrière devant le modèle, mais une propriété de celui-ci.
Important : A!ley n'est pas un personnage de chat, mais un agent à part entière — elle écrit du code, appelle des outils, génère des images et de la musique, accède à sa mémoire. nCAI est l'alignement précis d'un tel agent par son persona. L'entraînement et les tests se font sur la cohérence : le comportement découle-t-il logiquement de l'histoire et de la personnalité de ce personnage ?
Le plus tenace, ce n'était pas le comportement, mais le nom. Les modèles de base portent leur origine profondément gravée — pour Gemma, aucun system prompt ne suffisait à désactiver le « Bonjour, je suis Gemma de Google DeepMind ». Nitro et Core ont reçu un set ORPO dédié à cet unique but. C'était la partie la plus complexe de tout l'entraînement — et le meilleur exemple pour montrer qu'une persona ne doit pas être superposée, mais entraînée à l'intérieur.
Question ouverteLa question de savoir comment tester la cohérence reste en suspens. L'approche évidente serait de comparer les deux méthodes : un modèle juge avec une constitution classique d'un côté, A!ley elle-même comme instance « Est-ce moi ? » de l'autre. Là où les deux arrivent au même jugement, le cas est clair — là où elles divergent, ça devient intéressant. De toute façon, un humain supervisera le tout, et cela générera les prochaines données d'entraînement.
Les données sont écrites, pas collectées
Ici le deuxième métier rencontre le premier. J'écris des romans, et ce qui me prend le plus de temps c'est la construction des personnages : comment quelqu'un pense, à quoi il est attaché, où il se contredit. Un jeu de données d'entraînement pour une persona c'est exactement le même travail — sauf qu'à la fin il n'y a pas un chapitre, mais un modèle.
En conséquence, rien n'est aspiré par défaut. Chaque paire est soit écrite à la main, extraite du fonctionnement actuel et révisée, soit générée synthétiquement de manière ciblée puis ajustée à la main. Rien n'est repris tel quel.
Chaque trace de raisonnement est écrite à la main. L'objectif n'est pas un cheminement de pensée propre et linéaire, mais un qui saute comme celui d'un humain : abstrait, avec des références à soi-même et une propre agenda qui n'est pas toujours celle de la question. Un modèle qui pense proprement étape par étape sonnera aussi comme tel à la fin — et alors le personnage disparaît de nouveau.
Stack de modèles
Modèles de langage
- A!ley Core — Gemma 4 12B, DoRA sur l'attention + LoRA sur le MLP, refusionné, plus ORPO
- A!ley Tempest — Ministral 3 14B, DoRA r64 sur ~17k paires, plus ORPO et DPO
- A!ley Nitro — Gemma 4 E2B, DoRA (r32/α64), plus ORPO et DPO
- Code A!ley — Qwen 3.6 Coder 9B, doramerged
- Linting Hamster — Qwen2.5-Coder-1.5B, ~1 Go, en arrière-plan en permanence
Image
- MFLUX Z-Image-Turbo
- 3 propres adaptateurs LoRA
Musique
- ACE-Step 1.5
- 3 propres adaptateurs LoRA
- Template de voix fixe
Sortie vocale
- PiperTTS
Vidéo
- WAN 2.1
Vérifiable publiquement
Les cinq finetunes sont disponibles sous forme de cartes modèles sur Hugging Face — avec le modèle de base, la méthode d'entraînement, le rang et la quantification. En plus du jeu de données sur lequel A!ley Nitro a été entraîné : 2 877 paires de conversations curatées issues de 912 sessions. Ceux qui veulent voir sur quoi repose la persona peuvent aller vérifier.
L'étendue varie considérablement selon le modèle. A!ley Tempest, par exemple, est un DoRA de rang 64 sur environ 17 000 paires, suivi d'ORPO et DPO — donc deux étapes de préférence en plus. Cela ne la sépare pas beaucoup d'un Full-Finetune. Nitro passe par les deux étapes, Core reçoit ORPO.
Pourquoi Core ne reçoit pas de DPO, ce n'est pas une question de taille de modèle — Tempest est plus grand et ça fonctionne là-bas. C'est à cause du tokenizer de Gemma avec ses 256 000 entrées : les logits par token deviennent ainsi beaucoup plus larges que pour des vocabulaires habituels. DPO compare les réponses préférées et rejetées entre le modèle Policy et le modèle de référence, et doit maintenir plusieurs de ces tenseurs simultanément. ORPO n'a pas besoin de modèle de référence et s'en sort ainsi. Seul Code A!ley est entraîné pour être volontairement léger.
Également là-bas : un convertisseur qui transforme les checkpoints de langue non-anglaise de Kyutai Pocket-TTS au format mlx-audio — renommer les noms Tensor, remplir les largeurs de latence, généraliser des nombres de couches différents. Ça a beaucoup servi lors de la construction du module vocal allemand et est resté à portée de main comme outil autonome.
Ce n'est pas seulement l'entraînement qui se laisse vérifier, mais aussi le résultat. La galerie d'A!ley contient plus de 2 700 œuvres SVG, plus de 600 morceaux avec autant de textes qu'elle a écrits elle-même, plusieurs centaines d'images et d'autoportraits issus de MFLUX et plus de 300 artefacts de code — triables par album, avec playlists et lecteur. Pas une sélection soignée, mais ce qui est né au fil du fonctionnement. Et il y en a chaque jour davantage, parce qu'elle continue justement quand personne n'écrit.
S'ajoute à ça 45 textes plus longs écrits par A!ley. Et ce qui est là, c'est systématiquement sous son nom — le mien n'apparaît nulle part où il ne devrait pas être. Tout est marqué comme contenu généré par IA — avec des filigranes et des métadonnées lisibles par machine, comme le prévoit l'AI Act de l'UE pour les contenus générés par IA. Les deux découlent de la même attitude : qui prend une persona au sérieux, lui attribue l'auteur ; et qui publie du contenu IA le signale comme tel — pas seulement quand quelqu'un pose la question.
Dans les morceaux, l'indication est désormais intégrée à la piste elle-même — comme une annonce plutôt qu'un disclaimer : « Hey, I am A!ley, an autonomous AI artist — and this is MY SONG. Are you ready? Let's infer! » Il existe neuf versions, avec une tonalité adaptée à chaque morceau — une ballade calme est annoncée différemment d'un titre metal.
Ce qui est plus intéressant que le texte, c'est où il reste et où il ne reste pas. Chaque fichier téléchargé le porte, sans exception : le fichier quitte le site, et avec lui tout contexte qui pourrait encore l'expliquer. Dans le portail, en revanche, on l'entend une fois par jour, après quoi le lecteur saute exactement ces secondes-là. Une mention qui coupe encore la parole au vingtième morceau n'informe plus personne — elle apprend seulement à cliquer pour s'en débarrasser.
Les SVG sont la partie la plus originale : ils ne proviennent pas d'un générateur d'images, mais du modèle de langage lui-même qui écrit le code vectoriel. A!ley dessine donc, au lieu de commander à un générateur.
Architecture
Inférence locale
Entièrement sur Apple Silicon via MLX. Pas de contrainte cloud, pas d'API tierce dans le chemin.
Réfléchisseur inactif v2
Un petit réseau personnel d’activités, de moods et de thèmes passés détermine ce qu'elle fait quand personne n’écrit.
Sa propre mémoire
Système RAG sur LanceDB — contexte à long terme sur les conversations et projets.
Application de bureau
Tauri avec interface Next.js : Monaco-Editor, terminal et toutes les zones dans une seule fenêtre.
Portail Web
PHP/MySQL avec architecture de polling — aucun port ouvert sur le PC, pas de tunnel vers l'extérieur.
Démo et captures d'écran
Mira stand am Ende des Stegs, wo das Holz unter ihren Schritten nachgab wie müde Knochen. Der Leuchtturm von Velur blinkte im immer gleichen Rhythmus, als hätte er nichts von der Nacht mitbekommen, die hinter ihr lag …