lundi 7 septembre 2026

Mon benchmark

Je benchmark dorénavant mes modèles, que ce soit frontier ou locaux, en leur demandant de créer un raytracer en Python, puis en C++, avec un prompt simple (sphère miroir sur un plan en damier) ou plus complexe (monte carlo path tracing, transparence, tores, bump mapping...). Et là, il a fallu se rendre à l'évidence : la taille du modèle compte. Même les modèles open weight comme Kimi ou GLM finissent par doner quelque chose de raisonable dans le prompt complexe, là où mon Devstral-mini mouline un bon bout de temps sur le prompt le plus simple, pour finalement me renvoyer une page blanche. Il y a encore du boulot !

Aucun commentaire: