GPAI Ledger The public record of EU AI Act training-data summaries

GPAI LedgerFastwebMIIA (Fastweb) › Capture 11 Aug 2026

FastwebMIIA — capture 20260811T103202Z

ProviderFastweb
Targetprovider site — https://www.fastweb.it/grandi-aziende/artificial-intelligence/fastweb-miia/documentazione-trasparenza-ai/sintesi%20contenuti%20training.pdf
Fetched (UTC)2026-08-11T10:32:02Z
Stored file1f0b95d1b02074113265118c16d137dc910805426e61a26d9973e4bb0655fa72.pdf (238,579 bytes)
SHA-2561f0b95d1b02074113265118c16d137dc910805426e61a26d9973e4bb0655fa72
OpenTimestamps proof1f0b95d1b02074113265118c16d137dc910805426e61a26d9973e4bb0655fa72.pdf.ots (calendar-attested; anchored in bitcoin over time)
WaybackWayback snapshot, 2026-08-11 10:32 UTC
Prior capture of this target— first capture of this target
Notestext_sha256 recorded 20 Aug 2026 from the extracted.txt stored at capture time (bootstrap captures predate this field); raw bytes unchanged

Verify: sha256sum 1f0b95d1b02074113265118c16d137dc910805426e61a26d9973e4bb0655fa72.pdf must equal the hash above (the filename IS the expected hash); ots verify 1f0b95d1b02074113265118c16d137dc910805426e61a26d9973e4bb0655fa72.pdf.ots -f 1f0b95d1b02074113265118c16d137dc910805426e61a26d9973e4bb0655fa72.pdf (opentimestamps.org) proves the capture time (fresh proofs report 'pending' until bitcoin-anchored, typically within a day).

Extracted text

Machine-extracted text (layout may be lost; the authoritative content is the stored file above).

Fastweb S.p.A. - Sede legale e amministrativa Piazza Adriano Olivetti, 1 - 20139 Milano Tel. [+39] 02.45451
Capitale Sociale euro 41.344.209,40 i.v. Codice Fiscale, Partita Iva e Iscrizione nel Registro Imprese di Milano 12878470157
Fastweb S.p.A. - Società soggetta all’attività di direzione e coordinamento di Swisscom AG

SINTESI DEI CONTENUTI USATI PER L’ADDESTRAMENTO DEL MODELLO EX. ART 53 PAR. 1 LETT D) DEL
REGOLAMENTO (UE) 2024/1689 - EU AI ACT
30.07.2026 – v3
Il presente documento contiene l’indicazione dei contenuti utilizzati per il training del modello ai sensi dell’art. 53 par. 1 lett
d) del Regolamento n. 2024/1689 (EU AI Act), dalla fase di pre-training alla fase di fine-tuning.
Tale documentazione è resa pubblicamente disponibile con l’obiettivo di aumentare la trasparenza sui dati utilizzati nelle
fasi di pre-addestramento e addestramento del modello di AI per finalità generali, al fine di agevolare le parti con interessi
legittimi (inclusi i titolari del diritto d’autore e gli interessati) nell’esercitare e far rispettare i loro diritti ai sensi della normativa
dell’Unione, rispettando al contempo i segreti industriali.
Tale documentazione deve essere di carattere generale e narrativo, anziché dettagliata sotto il profilo tecnico, deve cioè
indicare le principali raccolte o serie di dati che sono state inserite nell’addestramento del modello, quali grandi banche d ati
o archivi di dati privati o pubblici.
1. Informazioni generali
1.1 Identificazione del fornitore e recapiti Nome e recapiti del fornitore Fastweb S.p.A., Piazza Adriano Olivetti 1,
20139 Milano, Italia.
Società a socio unico soggetta all'attività di
direzione e coordinamento di Swisscom
AG.
Rappresentante autorizzato N/A, fornitore stabilito in UE.
1.2 Identificazione del modello  Nome/i del modello e versione: FastwebMIIA ( Modello Italiano di
Intelligenza Artificiale)
• FastwebMIIA-7B

• FastwebMIIA-7B-2603
Dipendenze del modello: N/A
Data di immissione sul mercato
dell'Unione:
29/05/2025 (FastwebMIIA -7B)
23/03/2026 (FastwebMIIA-7B-2603)
Descrizione del modello  FastwebMIIA è un auto -regressive Large
Language Model (LLM) basato su
un’architettura di dense decoder -only
Transformer. Fastweb ha inserito alcuni
moduli custom come il tokenizzatore,
sviluppato in -house. Nella sua versione
FastwebMIIA-7B-2603, il modello è
ottimizzato per il function calling, per
abilitare interazioni con strumenti esterni
tramite chiamate a funzioni, ed il
Contextual QA e per rispondere a
domande su testi e documenti secondo il
framework standard della RAG – Retrieval
Augmented Generation. Il modello non
presenta un rischio sistemico ai sensi
dell’AI Act.
1.3. Modalità, dimensione complessiva
dei dati di addestramento e altre
caratteristiche

Modalità ☒ Testo
☐ Immagine
☐ Audio
☐ Video

☐ Altro
Dimensione dati di addestramento ☒ Testo - da 1 miliardo a 10.000 miliardi di
token (circa 1,5 × 2 × 10¹² token). Il modello
è esclusivamente un modello testuale.
Tipi di contenuto per dati testuali  A titolo meramente esemplificativo e non
esaustivo: testi di narrativa e letteratura ,
testi scientifici ed educativi , pubblicazioni
giornalistiche, documenti legali  e ufficiali,
informazioni promozionali, codice
informatico, dati storici.

Tipologia contenuti grafici

N/A
Non presenti.
Tipologia contenuti video

N/A
Non presenti.
Tipologia contenuti audio N/A
Non presenti
Data più recente di acquisi zione/raccolta
dei dati per l’addestramento del modello
Maggio 2025
Descrizione delle caratteristiche
linguistiche dei dati di addestramento
complessivi
Il modello è stato addestrato su un corpus
eterogeneo di dati esclusivamente
testuali, raccolti prevalentemente in lingua
italiana e inglese, con una minore presenza
di testi in altre lingue europee e non
europee. La distribuzione  linguistica
riflette un focus specifico sull’italiano, al
fine di garantire una buona performance
del modello su questa lingua.

Altre caratteristiche rilevanti dei dati di
addestramento complessivi
Il dataset copre una vasta gamma di aree
tematiche, tra cui:
• Letteratura e scienze umane: testi
narrativi, saggistica, filosofia, critica
letteraria;
• Materie scientifiche: testi relativi a
matematica, fisica, biologia,
informatica, ingegneria;
• Scrittura di codice informatico :
esempi di codice, principalmente
python, documentazione tecnica;
• Nozioni storiche e cultura
generale: contenuti enciclopedici,
fonti educative e divulgative;
• Altri ambiti di uso generale: tra cui
diritto, economia, arte, attualità e
linguaggio conversazionale;
• Scrittura creativa : contenuti da
quotidiani e articoli divulgativi.

Per quanto riguarda la modalità, i dati
utilizzati sono esclusivamente testuali.
Non sono stati inclusi dati multimodali (es.
immagini, audio o video).

Tutti questi dati sono stati utilizzati sia in
formato ‘plain text’ durante la fase di pre -
training, sia in formato Q&A o multiturn
per le fasi di post-training.
Ulteriori osservazioni È stata predisposta una sezione di
trasparenza pubblicamente accessibile,
con l'obiettivo di fornire informazioni
precise, chiare e in un linguaggio

comprensibile su quanto realizzato per
addestrare FastwebMIIA e sul suo
funzionamento. Vedasi: FastwebMIIA -
Prodotti Artificial Intelligence | Grandi
Aziende | Fastweb
2. Elenco delle fonti dei dati
2.1 Set di dati disponibili al pubblico Sono stati utilizzati dataset pubblicamente
disponibili per addestrare il modello?
☒ Sì
Modalità dei contenuti coperti ☒ Testo
Elenco dei set di dati di grandi dimensioni
disponibili al pubblico
Common Crawl
Archivio web pre -compilato, realizzato
attraverso scraping non indiscrim inato sul
web, che rappresenta circa l'85% del
corpus di addestramento totale.
Secondo quanto dichiarato dalla stessa
organizzazione, Common Crawl rispetta le
regole "robots.txt" specificate dai siti web,
che governano l'accesso dei web crawler ai
loro contenuti e non effettua il crawling di
pagine esplicitamente vietate da queste
regole.
Sono state utilizzate solo porzioni del
dataset, selezionate tramite filtraggio
qualitativo, filtraggio linguistico e
deduplica.
Periodo di raccolta: marzo 2024 – febbraio
2025
Si rinvia a Common Crawl - FAQ, in cui si
esplicitano le attività di scraping condotte
nel rispetto del protocollo robot.txt, e
facendo inoltre il possibile per individuare
e rispettare altre riserve espresse sui diritti

ai sensi dell’art. 4, par. 3, Direttiva
2019/790
RedPajama
RedPajama-Data-v2 è un dataset aperto
per il pre -training di LLM, costruito a
partire da 84 snapshot di Common Crawl.
Contiene oltre 30 trilioni di token filtrati e
deduplicati (più di 100 trilioni di token
grezzi) in cinque lingue: inglese, francese,
spagnolo, tedesco e italiano.
Periodo di raccolta: marzo 2024 – febbraio
2025
FineWeb Edu – FineWeb Edu è un dataset
aperto per il pre -training di LLM, derivato
da FineWeb — a sua volta costruito a
partire da Common Crawl. Contiene oltre
18,5 trilioni di token di testi in inglese,
filtrati, deduplicati e selezionati per il loro
contenuto di natura educativa.
Periodo di raccolta: marzo 2024 – febbraio
2025
Wikipedia - wikimedia/wikipedia ·
Datasets at Hugging Face
Rappresenta circa l'1% del corpus di
addestramento totale. Acquisito tramite
libreria Hugging Face.
Periodo di raccolta: marzo 2024 – febbraio
2025
2.2 Set di dati privati non disponibili al pubblico ottenuti da terze parti
2.2.1 Dataset concessi in licenza dai
titolari dei diritti o dai loro
rappresentanti
Sono stati conclusi accordi di licenza
commerciale con titolari dei diritti o con i
loro rappresentanti?
☒ Sì
Modalità dei contenuti coperti ☒ Testo

Descrizione generale dei set di dati privati
non di dominio pubblico ottenuti da terze
parti
Contenuti editoriali, didattici, divulgativi e
statistico-istituzionali in lingua italiana,
acquisiti tramite accordi di licenza
commerciale stipulati direttamente con i
rispettivi titolari dei diritti. Tali accordi
autorizzano espressamente l'utilizzo dei
contenuti per finalità di addestramento di
modelli di intelligenza artificiale.
2.2.2 Set di dati privati ottenuti da terze
parti
Sono stati ottenuti dataset privati da terze
parti non concessi in licenza come
descritto nella Sezione 2.2.1?
☒ No

2.3 Dati ottenuti tramite crawling e
scraping da fonti online
Sono stati utilizzati crawler dal fornitore o
per conto del fornitore?
☒ No
Ulteriori osservazioni Fastweb non ha condotto alcuna attività
diretta di crawling o scraping di fonti
online. Tutti i dati provenienti da fonti
online sono stati acquisiti esclusivamente
attraverso dataset pre -compilati e
pubblicamente disponibili come descritto
nella Sezione 2.1. Nessun crawler
proprietario è stato sviluppato o operato
da Fastweb o per suo conto.
2.4 Dati degli utenti  Sono stati utilizzati dati provenienti
dall'interazione degli utenti con il modello
di AI (es. input e prompt degli utenti) per
addestrare il modello?
☒ No

Sono stati utilizzati dati raccolti
dall'interazione degli utenti con altri servizi
o prodotti del fornitore per addestrare il
modello?
☒ No
Ulteriori osservazioni Nessun dato proveniente dall'interazione
degli utenti con il modello è stato utilizzato

per il training.  Inoltre, i dati inseriti dagli
utenti durante l'utilizzo di FastwebMIIA
non vengono raccolti né utilizzati per
attività di retraining o fine -tuning del
modello. In nessun caso vengono utilizzati
dati dei clienti di Fastweb per
l'addestramento del modello.

Per maggiori informazioni , vedasi  la
sezione “Data Journey ” in FastwebMIIA -
Prodotti Artificial Intelligence | Grandi
Aziende | Fastweb
2.5 Dati sintetici  Sono stati creati dati sintetici generati da
AI dal fornitore o per suo conto per
addestrare il modello?
☒ Sì
Modalità dei dati sintetici: ☒ Testo
Modello/i di AI per finalità generali
utilizzato/i per generare i dati sintetici:
Phi 3.5 (Microsoft), rilasciato sotto licenza
MIT
Dimensione Inferiore all'1% del corpus di
addestramento totale.
2.6 Altre fonti di dati  Sono state utilizzate fonti di dati diverse da
quelle descritte nelle Sezioni 2.1 -2.5 per
addestrare il modello?
☒ No
3. Aspetti relativi al trattamento dei dati
3.1 Rispetto della riserva di diritti
concernenti le eccezioni o limitazioni
relative all'estrazione di testo e di dati
Siete firmatari del Code of Practice per i
modelli di AI per finalità generali che
include impegni a rispettare le riserve dei
diritti dall'eccezione TDM?
☒ Sì
Descrivere le misure implementate prima
dell'addestramento del modello per
rispettare le riserve dei diritti
Fastweb ha utilizzato esclusivamente fonti
autorizzate (dataset licenziati e
partnership) e dataset pre -compilati
pubblicamente disponibili (Common

dall'eccezione TDM, inclusi i protocolli e le
soluzioni di opt-out onorati dal fornitore
Crawl, RedPajama, FineWeb Edu) che,
secondo quanto dichiarato dai rispettivi
operatori, rispettano i protocolli robots.txt
che governano l'accesso dei web crawler ai
contenuti e non effettuano il crawling di
pagine esplicitamente vietate da tali
regole.

È stato predisposto un canale di
comunicazione pubblicamente accessibile
per consentire ai titolari dei diritti di
esercitare il proprio diritto di opt -out ai
sensi dell'art. 4, par. 3, della Direttiva (UE)
2019/790. Per maggiori informazioni ,
vedasi la sezione “Riserva dei diritti ” in
FastwebMIIA - Prodotti Artificial
Intelligence | Grandi Aziende | Fastweb
3.2 Rimozione dei contenuti illegali  Descrizione generale delle misure
adottate per evitare o rimuovere dai dati di
addestramento i contenuti illegali ai sensi
del diritto dell'Unione
Fastweb mantiene e aggiorna
regolarmente una blacklist di siti
potenzialmente dannosi o contenenti dati
personali, applicata per filtrare alla fonte gli
URL presenti nei dati di Common Crawl.
È stata  altresì sviluppata una pipeline di
pulizia dei dati personalizzata e
progressiva, che incorpora le migliori
pratiche presenti in letteratura, al fine di
generare un corpus italiano progettato per
l'addestramento di LLM specifici per la
lingua. La pipeline prevede:
• pulizia e normalizzazione dei dati
testuali grezzi;
• deduplica;

• filtraggio basato sull'identificazione
della lingua e sulla qualità semantica
dei documenti;
• rimozione delle Personal Identifiable
Information (PII): per ciascun
documento viene applicata
un'euristica di rilevamento PII — se
vengono rilevate meno di 5 istanze,
queste vengono mascherate/rimosse ,
se ne vengono rilevate 5 o più, l'intero
documento viene rimosso dal corpus;
• selezione delle fonti con esclusione dei
dataset contenenti informazioni
sensibili o non conformi alle normative
sulla privacy.
Il corpus di addestramento è stato più volte
bilanciato durante il processo di training
per garantire la rappresentatività dei
diversi domini e la copertura dei task
desiderati.
3.3 Altre informazioni  Altre informazioni pertinenti sul
trattamento dei dati
Occorre chiarire  il progetto in cui si
inserisce la presente valutazione. Per
garantire l’efficace funzionamento di un
modello di AI per fi nalità generali  è
fondamentale che lo stesso sia addestrato
con dati testuali, nei quali possono essere
anche compresi potenzialmente dati
personali. Tali dati, infatti, sono essenziali
per garantire un livello adeguato di
conoscenza fattuale e contestuale,

nonché per migliorare la comprensione e la
generazione del linguaggio naturale.
Fastweb, occorre precisarlo, non ha
interesse a sfruttare direttamente dati
personali in chiaro al fine di ottenere un
beneficio economico diretto, ma di
garantire l’efficacia di un modello
linguistico di grandi dimensioni che solo
per mezzo dell’addestramento tramite tali
dati può risultare performante.
Ed invero, senza l'impiego di tali
informazioni, il modello risulterebbe
limitato nella sua capacità di fornire
risposte accurate e contestualizzate,
compromettendo la sua utilità e
affidabilità. E’ per tale ragione che Fastweb
ha necessità di trattare alc uni dati
personali come, ad esempio, quelli relativi
ad eventi storico -scientifici, fatti notori
rilevanti sotto il profilo culturale globale,
europeo o nazionale.
L’addestramento di un modello linguistico
di grandi dimensioni (LLM) comporta un
equilibrio tra l’esigenza di utilizzare dati
testuali, inclusi potenzialmente dati
personali, e la necessità di garantire la
tutela della privacy. Per ridurre al minimo il
rischio per gli interessati, Fastweb ha
implementato diverse misure di
mitigazione, tra le quali:
1. selezione accurata delle fonti dati,
escludendo dataset contenenti
informazioni sensibili o non

conformi alle normative sulla
privacy;
2. pipeline di pulizia e
anonimizzazione, che rimuove dati
personali e informazioni
identificabili prima
dell’addestramento, assicurando
minor impatto e presenza dei dati
personali. In particolare, per ogni
documento, viene applicata
un'euristica di rimozione delle
Personal Identifiable Information
(PII), se presenti in numero
inferiore a 5, altrimenti viene
rimosso l'intero documento.
Si sottolinea, infine, che la principale fonte
di dati personali utilizzati per il training è
Wikipedia, per la quale valgono le seguenti
considerazioni:
1. l’insieme delle versioni utilizzate, in
italiano ed inglese, rappresenta
solo circa l’1% dell’intero corpus di
dati utilizzati;
2. Wikipedia contiene in larga misura
informazioni di personaggi storici o
famosi (le cui informazioni sono di
facile accesso pubblico in ogni
caso) o legati a fatti di cronaca
esposti mediaticamente (riportate
in atti pubblici);
3. la natura principalmente
enciclopedica dei contenuti e dei

dati personali ivi pubblicati fa
propendere per una bassa
rischiosità del trattamento degli
stessi;
4. la pipeline di pulizia per le fonti
provenienti da Internet descritta
sopra, comprensiva anche di forme
di esclusione e masking delle
informazioni riferite a persone
fisiche identificate o identificabili,
viene applicata per tutte le fonti ad
eccezione di Wikipedia.
Non sono presenti immagini nel dataset
usato.
È stata  predisposta una sezione di
trasparenza pubblicamente accessibile  a
questo link, con l'obiettivo di fornire
informazioni precise, chiare e in un
linguaggio comprensibile su quanto
realizzato per addestrare FastwebMIIA e
sul suo funzionamento. La sezione
descrive il data journey dei dati personali
attraverso tutte le fasi del ciclo di  vita del
modello e documenta le misure adottate
per assicurare il rispetto degli standard
legali ed etici stabiliti dall'AI Act, dalla
Direttiva Copyright e dal GDPR. È inoltre
presente un canale di comunicazione
diretto per l ’esercizio dei di ritti degli
interessati.