Il 25 giugno 2026 il gruppo di Euan Ashley a Stanford pubblica su arXiv OpenMHC: Accelerating the Science of Wearable Foundation Models, dataset e benchmark per modelli fondazionali da wearable, arrivato alla terza versione l’8 agosto. L’abstract annuncia «open-source code and model weights» e dati ad accesso allargato. Questo è lo stato dei repository al 12 agosto.
Cos’è
OpenMHC, per esteso OpenMyHeartCounts, deriva da oltre dieci anni di raccolta tramite l’app dello studio My Heart Counts. Il dataset dichiarato nel paper:
- 67 milioni di ore di segnale da wearable
- 19 canali di sensore — passi, frequenza cardiaca, sonno, allenamenti
- fino a 169 variabili collegate — salute, stile di vita, umore, comportamento
- 11.894 partecipanti sui 16.993 dello studio, quelli che hanno acconsentito alla condivisione allargata
Accanto ai dati ci sono implementazioni di modelli fondazionali recenti, fra cui adattamenti di LSM2 di Google e di WBM di Apple, e un benchmark unificato su tre tracce: predizione di variabili di salute e comportamento, imputazione di dati mancanti e previsione di serie temporali. Repository github.com/AshleyLab/OpenMHC, classifica su uno Space di Hugging Face.
Stato di rilascio
Il README contiene un piano di rilascio a caselle. Al 12 agosto quattro sono spuntate:
- paper su arXiv
- codice di valutazione
- checkpoint su Hugging Face
- Space del benchmark
Quattro non lo sono:
- dataset — «will be made available to all qualified researchers free of charge upon acceptance of the paper»
- infrastruttura di addestramento ripulita — stima «July-August»
- esempi d’uso dei modelli pre-addestrati — stima «July-August»
- adattatore per gli export di Apple HealthKit — stima «July-September»
Codice
Il repository principale github.com/AshleyLab/OpenMHC è stato creato il 28 aprile 2026, ha ricevuto l’ultimo push il 9 agosto e conta 39 stelle. Contiene il codice di valutazione, l’API per eseguire metodi propri sul benchmark e le implementazioni di riferimento.
La licenza del codice è dichiarata due volte e mai concessa. pyproject.toml alla riga 11 riporta license = { text = "MIT" } e la sezione ## License del README ripete «Code: MIT». Un file di licenza non c’è: LICENSE, LICENSE.md, LICENSE.txt e COPYING rispondono 404, e il rilevatore di GitHub non riporta alcuna licenza. La MIT richiede che il proprio testo e la nota di copyright accompagnino le copie, quindi la dichiarazione da sola non mette in condizione di riusare il codice.
Il codice di addestramento è in parte qui: src/imputation_training/ e src/forecasting_training/, i comandi mhc-impute-train e mhc-forecast-train dichiarati in [project.scripts], le configurazioni Hydra sotto configs/training/ e configs/forecasting_train/ e gli script SLURM in jobs/. La casella non spuntata riguarda la versione ripulita, e per il resto il README rimanda a un secondo repository: «The research-grade codebased can be found here https://github.com/NarayanSchuetz/OpenMHC (particularly relevant for training infra, until we ported that properly)». Quel repository è sotto licenza MIT, ha 4 stelle ed è stato creato il 7 maggio 2026, data del suo unico push. I checkpoint pubblicati sono di fine maggio e giugno.
Pesi
14 checkpoint pubblicati sull’organizzazione MyHeartCounts di Hugging Face fra il 29 maggio e il 22 giugno 2026. Il formato non è uniforme: 5 repository pubblicano un checkpoint PyTorch .ckpt, 8 un artefatto PyPOTS .pypots e uno, openmhc-chronos2-fc, un model.safetensors sotto checkpoint/. openmhc_manifest.json c’è in tutti e 14; normalization_stats.json in 9, mentre openmhc-dlinear-fc, openmhc-mixlinear-fc e openmhc-segrnn-fc usano standard_scaler_stats.json con training_config.json, e openmhc-chronos2-fc e openmhc-toto-fc non pubblicano statistiche di normalizzazione.
Le licenze dichiarate nelle schede non sono uniformi:
- OpenRAIL — 8 checkpoint:
openmhc-lsm2-daily,openmhc-lsm2-weekly,openmhc-lsm2-weekly-sparse,openmhc-brits-imp,openmhc-dlinear-imp,openmhc-dlinear-7day-imp,openmhc-fedformer-imp,openmhc-timesnet-imp - CC BY 4.0 — 6 checkpoint:
openmhc-chronos2-fc,openmhc-dlinear-fc,openmhc-mixlinear-fc,openmhc-segrnn-fc,openmhc-toto-fc,openmhc-wbm-dp
La divisione segue le tracce: OpenRAIL copre gli 8 checkpoint della traccia di imputazione, CC BY 4.0 i 5 di forecasting e l’unico di predizione a valle. La sezione ## License del README dichiara però «Models OpenRAIL» senza distinzioni, e 6 checkpoint su 14 stanno sotto un’altra licenza: chi riusa i pesi deve leggere la scheda di ogni modello.
Dati
DATASET.md indica Harvard Dataverse come sede del dataset: circa 38 GB, con il DOI riportato come «Available upon paper acceptance». Oggi si scarica il sottoinsieme di sviluppo version="xs", 593 utenti e circa 1,9 GB, cioè il 5,0% della coorte, destinato a quickstart e smoke test. L’API espone openmhc.download_dataset(version=…, dest=…) e scrive nella destinazione un marcatore dataset_version.json che la valutazione ricontrolla.
L’accesso al rilascio completo è regolato. Il paper riporta l’approvazione etica di Stanford, protocollo IRB-31409, e un consenso digitale in cui ogni partecipante ha scelto fra condivisione «narrow», con la sola Stanford, e «broad», con i ricercatori qualificati di tutto il mondo. Il dataset rilasciato è formato dai soli «broad»: 11.894 utenti e 67 milioni di ore su 16.993 utenti e oltre 80 milioni di ore raccolte. Quando la distribuzione è vincolata a un accordo d’uso, l’accesso richiede un token API Dataverse.
Su dati sanitari individuali nessuna licenza OSI è applicabile. Il vincolo viene dal consenso firmato dai partecipanti e detta la forma della distribuzione, la stessa che ho descritto progettando RAG clinici on-premise.
Rispetto alla Open Source AI Definition
La Open Source AI Definition 1.0 richiede tre componenti insieme. Il codice «shall be made available under OSI-approved licenses»; per informazioni sui dati e parametri la formula è più larga, «under OSI-approved terms». Lo stato al 12 agosto:
- Informazioni sui dati — il requisito riguarda la descrizione, e contempla espressamente i dati non condivisibili, di cui chiede «the complete description of all data used for training, including (if used) of unshareable data, disclosing the provenance of the data, its scope and characteristics». Il paper descrive coorte, canali, variabili, 92 modelli di dispositivo e un arco di tredici anni; la descrizione non è pubblicata sotto termini approvati da OSI.
- Codice — «the complete source code used to train and run the system». Valutazione e addestramento sono pubblicati, senza file di licenza in nessuno dei due repository che li contengono.
- Parametri — pubblicati, sotto OpenRAIL per 8 checkpoint e CC BY 4.0 per 6.
Le due licenze mancano il bersaglio per ragioni diverse. OpenRAIL contiene restrizioni d’uso comportamentali, che ricadono nella clausola 6 della Open Source Definition — «No Discrimination Against Fields of Endeavor» — e fra i motivi ricorrenti di rigetto OSI elenca le clausole etiche e non commerciali. CC BY 4.0 non restringe l’uso e su quel fronte non pone problemi, ma è una licenza per opere creative: non concede diritti di brevetto e non è pensata per artefatti software.
È lo stesso confine misurato su DeepSeek-R1 e su GPT-NeoX, attraversato per intero da TinyLlama.
Sulle parti che non dipendono dal consenso dei partecipanti restano tre cose da fare: un file LICENSE nei repository del codice, una licenza unica per i 14 checkpoint allineata a quanto dichiara il README e una data per il dataset indipendente dall’esito della revisione.
Limiti
Quanto sopra descrive lo stato dei repository in un giorno, e le caselle non spuntate portano stime che scadono a settembre: la stessa verifica fra un mese può dare un esito diverso. Non ho eseguito il benchmark né riprodotto i risultati, cosa che il sottoinsieme al 5,0% non consente; sulle prestazioni dei modelli l’articolo non dice nulla. La classificazione delle licenze viene dai campi dichiarati nelle schede dei modelli e nel README, non da un parere legale, e la conformità di un rilascio alla definizione OSI la accerta OSI, non un lettore con le API.
- https://arxiv.org/abs/2607.16235
- https://github.com/AshleyLab/OpenMHC
- https://github.com/NarayanSchuetz/OpenMHC
- https://huggingface.co/MyHeartCounts
- https://myheartcounts-openmhc.hf.space
- https://myheartcounts.stanford.edu/openmhc
- https://opensource.org/ai/open-source-ai-definition
- https://opensource.org/osd
- https://opensource.org/licenses/common-reasons-for-rejection-of-licenses
Immagine di copertina: sfigmografo diretto di Étienne-Jules Marey, da La méthode graphique, Parigi 1878, p. 281 — pubblico dominio — https://commons.wikimedia.org/wiki/File:Marey_Sphygmograph.jpg