L'Observateur de la Superintelligence
Hugging Face

Comment l’AISI britannique et EvalEval rendent les résultats de benchmarks reproductibles

Un billet de Hugging Face présente les travaux de l’AI Security Institute britannique et de l’initiative EvalEval pour rendre reproductibles les résultats des benchmarks d’IA.

À lire aussi

OpenAI

OpenAI présente MentalHealthBench

OpenAI publie MentalHealthBench, un banc d’essai conçu avec des experts. Il mesure si les réponses d’une IA sont utiles et sûres dans des conversations réalistes portant sur la santé mentale.