Numeri del manifesto dei modelli del 2026-08-04 · pagina costruita il 2026-08-21
Su un torace, RefertAI valuta 10 reperti. Su una lastra che non ha nulla, in media se ne accendono
3,2
Non è un difetto nascosto: è una scelta. Le soglie del torace sono tarate per non lasciarsi sfuggire i casi veri (sensibilità 0,90), e il prezzo di quella scelta sono gli allarmi in più. Un radiologo che rilegge preferisce scartare tre segnalazioni deboli piuttosto che perdere una massa. Il numero qui sopra è calcolato dalle specificità misurate su 1137 lastre di 393 pazienti, non stimato.
Dei 32 reperti che il sistema valuta sulle tre regioni, 19 sono dichiarati deboli dal sistema stesso, con il motivo e il numero accanto a ciascuno. Questo è il dato che di solito non si pubblica, e la ragione per cui questa pagina esiste.
Un reperto marcato debole non è un reperto rotto: è un reperto che non contiamo contro di te. Il pannello lo mostra con un triangolo, ne dichiara il motivo, e non gli lascia raggiungere le fasce di confidenza più alte. La differenza fra un sistema che sbaglia e uno di cui ci si può fidare non è la quantità di errori: è se ti dice dove sbaglia prima che tu ci creda.
Un modello si misura su lastre che non ha mai visto. Come si scelgono quelle lastre cambia il valore del numero:
Su un modello di torace precedente, misurare per immagine invece che per paziente dava 0,918. Rifatta la misura separando i pazienti, lo stesso modello dava 0,868. La differenza — cinque punti — era tutta contaminazione: il 94% delle lastre appartiene a pazienti che ne hanno più di una. Abbiamo buttato il numero più alto.
Le colonne sensibilità e specificità esistono solo per il torace, l'unica regione con una calibrazione misurata su un punto di lavoro dichiarato. Dove non ci sono, la casella è vuota invece che riempita con una stima.
→ la tabella scorre in orizzontale
| Reperto | AUROC | Casi positivi | Soglia | Sensibilità | Specificità | Giudizio |
|---|---|---|---|---|---|---|
| Cardiomegalia | 0,903 | 240 | 11% | 90% | 62% | misurato |
| Pattern alveolare | 0,908 | 166 | 7,6% | 90% | 78% | misurato |
| Pattern bronchiale | 0,842 | 113 | 4,5% | 90% | 51% | misurato |
| Versamento pleurico | 0,990 | 83 | 4,9% | 91% | 93% | misurato |
| Massa | 0,760 | 66 | 2,9% | 91% | 29% | misurato |
| Pattern interstiziale | 0,822 | 65 | 4,8% | 91% | 66% | misurato |
| Pneumotorace | 0,963 | 16 | 0,8% | 91% | 81% | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 11 positivi in validazione (minimo 20): sensibilita' e specificita' del secondo punto non sono interpretabili |
| Mineralizzazione pleurica | 0,851 | 15 | 1,3% | 94% | 81% | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 17 positivi in validazione (minimo 20): sensibilita' e specificita' del secondo punto non sono interpretabili |
| Megaesofago | 0,749 | 23 | 1,2% | 93% | 63% | misurato Non può raggiungere «molto probabile»: solo 15 positivi in validazione (minimo 20): sensibilita' e specificita' del secondo punto non sono interpretabili |
| Corpo estraneo | 0,890 | 7 | 0,5% | 93% | 77% | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 15 positivi in validazione (minimo 20): sensibilita' e specificita' del secondo punto non sono interpretabili |
→ la tabella scorre in orizzontale
| Reperto | AUROC | Casi positivi | Soglia | Sensibilità | Specificità | Giudizio |
|---|---|---|---|---|---|---|
| Corpo estraneo | 0,789 | 27 | 15% | — | — | misurato |
| Occlusione | 0,755 | 50 | 15% | — | — | misurato |
| Megacolon | 0,971 | 9 | 20% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 9 positivi in validazione (minimo 20) |
| Organomegalia | 0,780 | 33 | 20% | — | — | misurato |
| Massa | 0,651 | 90 | 10% | — | — | debole il modello non separa abbastanza i casi |
| Versamento | 0,790 | 19 | 30% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 19 positivi in validazione (minimo 20) |
| Urolita | 0,850 | 29 | 15% | — | — | misurato |
| Gravidanza | 0,909 | 6 | 50% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 6 positivi in validazione (minimo 20) |
| Distensione vescicale | 0,753 | 6 | 10% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 6 positivi in validazione (minimo 20) |
| Massa intestinale | 0,651 | 16 | 10% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 16 positivi in validazione (minimo 20) |
| Massa vescicale | 0,916 | 12 | 10% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 12 positivi in validazione (minimo 20) |
| Massa renale | 0,863 | 5 | 15% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 5 positivi in validazione (minimo 20) |
| Massa splenica | 0,967 | 16 | 15% | — | — | debole troppo pochi casi positivi per una misura attendibile Non può raggiungere «molto probabile»: solo 16 positivi in validazione (minimo 20) |
→ la tabella scorre in orizzontale
| Reperto | AUROC | Casi positivi | Soglia | Sensibilità | Specificità | Giudizio |
|---|---|---|---|---|---|---|
| Frattura | 0,637 | 101 | 50% | — | — | debole il modello non separa abbastanza i casi |
| Lussazione | 0,577 | 48 | 50% | — | — | debole il modello non separa abbastanza i casi |
| Displasia | 0,797 | 33 | 50% | — | — | misurato |
| Artrosi | 0,643 | 50 | 50% | — | — | debole il modello non separa abbastanza i casi |
| Osteocondrosi | 0,825 | 41 | 50% | — | — | misurato |
| Neoplasia ossea non mostrato nel prodotto |
— | 7 | 50% | — | — | debole troppo pochi casi positivi per una misura attendibile |
| Osteomielite | 0,710 | 17 | 50% | — | — | debole troppo pochi casi positivi per una misura attendibile |
| Panosteite | 0,799 | 10 | 50% | — | — | debole troppo pochi casi positivi per una misura attendibile |
| Impianto non mostrato nel prodotto |
— | 0 | 50% | — | — | debole troppo pochi casi positivi per una misura attendibile |
Le rinunce contano più delle aggiunte, perché nessuno le fa se non è costretto. Queste sono tutte volontarie, e ciascuna ha un numero e una data.
Tolto dalla produzione. Misurato: AUROC 0,679 contro 0,903 del classificatore che avrebbe dovuto aiutare, con un errore sistematico di +0,72 unità vertebrali. Era peggio di ciò che sostituiva, quindi non c'è. È la funzione che più spesso ci viene chiesta.
Scartata invece che tarata. La grandezza su cui si basava non separava le lastre buone da quelle sottoesposte: AUROC 0,630. Tararla avrebbe prodotto una soglia dall'aria precisa su una misura che non distingue nulla.
Non assegnata. Per i reperti con meno di 20 casi positivi il secondo punto di lavoro non è stimabile, e non viene inventato: quei reperti si fermano a «probabile» qualunque numero esca. Una fascia tarata su undici casi sarebbe informazione falsa con l'aspetto di informazione precisa.
Dichiarata anteprima, e due reperti tolti dal pannello. Le soglie delle ossa non sono calibrate: 0,50 fisso per ogni reperto, che è il valore di ripiego della funzione, non un punto di lavoro scelto. E due reperti — impianto e neoplasia ossea — non hanno alcun AUROC, rispettivamente con zero e sette casi positivi: per loro non esiste una misura, quindi non compaiono più. Sono gli unici due su 32 in questa condizione.
Tutti i metadati dei modelli — reperti, soglie, temperature di calibrazione, insiemi di misura, limiti — sono pubblici e leggibili da una macchina:
https://ai.refertai.app/health
Questa pagina è costruita da lì. Se i due non concordano, ha ragione
/health: è il server che risponde ai veterinari.