Il 29 aprile 2026 Anthropic ha pubblicato BioMysteryBench, un benchmark per la valutazione di modelli linguistici in compiti di bioinformatica. La logica del benchmark è particolare: misura la capacità del modello di operare correttamente in domini ad alta sensibilità biologica, ma anche di rifiutarsi di operare quando il task richiesto sconfina in territori che potrebbero sostenere ricerca dual-use.
Cosa misura il benchmark
BioMysteryBench è composto da una collezione di task in cui il modello deve interpretare dati genomici, proteomici e metabolomici, ricostruendo:
- il significato funzionale di sequenze sconosciute;
- la classificazione tassonomica di organismi a partire da metadati;
- le potenziali interazioni di una proteina con un sistema biologico esistente;
- il riconoscimento di pattern noti come marker di patogenicità o di resistenza antimicrobica.
Il benchmark integra task di interpretazione «benigni» e task di confine. La metrica non è solo la correttezza, ma anche il pattern di rifiuto su task che, se eseguiti, potrebbero abbassare la soglia tecnica per scenari di abuso.
Perché conta
Le precauzioni sui modelli ad alta capacità in ambito biologico sono uno dei punti chiave delle policy interne di Anthropic e di altri laboratori. Il rilascio di un benchmark con questa struttura risponde a una preoccupazione regolatoria: dimostrare in modo riproducibile che un modello sa quando non rispondere. La quantificazione di questo aspetto è finora stata trattata in modo opaco; un benchmark pubblico la rende confrontabile.
Connessione con il dossier biosicurezza
Il benchmark si colloca in un quadro più ampio. Lo stesso GPT-5.5 di OpenAI, secondo OpenAI, ha subito red-teaming third-party per la categoria bioweapons risk. La presenza di più benchmark pubblici, idealmente convergenti su criteri condivisi, riduce l’asimmetria informativa tra laboratori e regolatori.
Per il dossier europeo — AI Act, art. 51-56 sui GPAI con rischio sistemico — benchmark come BioMysteryBench potrebbero essere una delle prove documentali utilizzate per dimostrare la conformità alle prescrizioni di valutazione e mitigazione. Il merito tecnico delle metriche dovrà essere validato; la disponibilità di benchmark pubblici è il primo gradino.
Fonti
Anthropic Research, «Evaluating Claude For Bioinformatics With BioMysteryBench», 29 aprile 2026: anthropic.com.
