Une levée d’amorçage pour industrialiser le jugement humain
La jeune société Intelligence, fondée en 2025 par Grace Li et Kamryn Ohly, vient d'annoncer un tour d'amorçage de 7,9 millions de dollars dirigé par Index Ventures, avec la participation de Valkyrie, Conviction (Sarah Guo et Mike Vernal) et A*. La startup commercialise la plateforme Design Arena, qui transforme le feedback des utilisateurs en une infrastructure d'évaluation destinée aux laboratoires de machine learning.
Le modèle repose sur la valorisation à grande échelle du jugement humain — ce qui inclut des critères esthétiques, d'ergonomie et d'attrait émotionnel — et s'appuie sur des méthodologies d'AI Evals et de RLHF (reinforcement learning from human feedback). Selon le dossier transmis, Intelligence revendique 5,3 millions d’utilisateurs et un ARR de 60 millions de dollars, chiffres qui en font d'emblée un acteur à surveiller pour les équipes produit des grands acteurs du secteur.
Pourquoi les benchmarks classiques montrent leurs limites
Jusqu'ici, l'évaluation des modèles génératifs reposait largement sur des métriques automatisées : perplexité pour le texte, FID ou CLIP pour l'image. Mais ces indicateurs, conçus pour mesurer des propriétés techniques, peinent à capter la désirabilité d'un produit — finesse visuelle, ergonomie d'une interface, ou attrait émotionnel. Les équipes d'ingénierie se trouvent confrontées à un paradoxe : des modèles techniquement performants mais incapables de générer des produits réellement désirables par le marché.
“les classements statiques qui reposent sur des métriques automatisées s’avèrent particulièrement vulnérabl”
Face à cette impasse, Intelligence propose d'industrialiser le feedback humain et de le transformer en signal d'entraînement stratégique pour les modèles, une approche qui séduit désormais investisseurs et grandes entreprises prêtes à payer l'accès au jugement utilisateur.
Modèle économique et implications
Le positionnement d'Intelligence mêle plateforme de collecte massive de feedback et services d'évaluation sur mesure pour laboratoires ML. Avec un ARR annoncé à 60 M$, la société semble avoir déjà converti une partie de son audience en revenus récurrents — un élément clé pour crédibiliser une plateforme centrée sur des données humaines plutôt que sur des métriques automatisées.
- Financement : 7,9 M$ en amorçage (Index Ventures lead)
- Utilisateurs : 5,3 M
- ARR : 60 M$
| Indicateur | Valeur |
|---|---|
| Levée d'amorçage | 7,9 M$ |
| Utilisateurs | 5,3 M |
| ARR | 60 M$ |
Reste à observer la durabilité de ce modèle : monétiser le jugement humain demande à la fois un dispositif d'engagement massif et des garanties de qualité et de représentativité des signaux collectés. Pour les laboratoires ML, l'enjeu est double : améliorer la « désirabilité » des systèmes tout en évitant des biais liés aux panels de testeurs ou aux préférences culturelles sur-représentées.
En misant sur le RLHF créatif et l'alignement esthétique, Intelligence propose une réponse directe au « evaluation bottleneck » qui freine la production de modèles véritablement orientés produit. Si la capacité à transformer l'avis utilisateur en signal d'entraînement robuste se confirme, la startup a les atouts pour devenir un fournisseur stratégique pour les développeurs de modèles génératifs — et pour pousser plus loin la professionnalisation des AI Evals.
La levée réalisée montre que les fonds misent désormais sur l'infrastructure humaine autant que sur les algorithmes. La suite dépendra de la capacité d'Intelligence à prouver que ses indicateurs humains peuvent se substituer, ou compléter, les métriques mathématiques sans introduire de nouvelles limites.