Comment l’AISI britannique et EvalEval rendent les résultats de benchmarks reproductibles
Un billet de Hugging Face présente les travaux de l’AI Security Institute britannique et de l’initiative EvalEval pour rendre reproductibles les résultats des benchmarks d’IA.