Estrazione di dati da documenti con OCR e NER personalizzato in Python — PickAClass
3.5 (2) ⏱ 2 h 54 min 📚 29 lezioni 🎧 Versione audio

Estrazione di dati da documenti con OCR e NER personalizzato in Python

Combina OpenCV, Pytesseract e SpaCy per scansionare documenti, estrarre testo e addestrare modelli di machine learning personalizzati per isolare le informazioni chiave.

  • 💬 Istruttore IA
    Fai domande su qualsiasi lezione e ricevi una risposta chiara all'istante, quando vuoi.
  • 🕐 Inizia quando vuoi
    Niente orari né scadenze: impara al tuo ritmo, quando vuoi.
  • 🌐 In italiano
    Lezioni, esercizi e certificato: tutto interamente nella tua lingua.

Informazioni sul corso

I documenti e le immagini scansionati grezzi contengono dati preziosi, ma sbloccare tali informazioni richiede di colmare il divario tra la visione artificiale e l'elaborazione del linguaggio naturale. Questo corso basato su testo ti guida attraverso il processo di costruzione di una pipeline intelligente per l'analisi dei documenti. Imparerai come pulire le immagini dei documenti, estrarre il testo grezzo e addestrare un modello personalizzato di Named Entity Recognition (NER) per identificare e strutturare automaticamente i punti dati cruciali. Cosa imparerai: - Comprendere i concetti fondamentali della visione artificiale, del riconoscimento ottico dei caratteri (OCR) e dell'elaborazione del linguaggio naturale. - Pulire e pre-elaborare le immagini dei documenti usando OpenCV per ottimizzarle per l'estrazione del testo. - Estrarre testo dalle immagini usando Pytesseract e formattarlo per l'elaborazione successiva. - Etichettare manualmente i dati testuali usando lo schema di tagging BIO (Inside-Outside-Beginning) per l'estrazione di entità personalizzate. - Addestrare un modello personalizzato di Named Entity Recognition (NER) usando le moderne pipeline di configurazione di SpaCy. - Strutturare il testo estratto in formati di dati puliti e validati usando moderne tecniche di validazione Python. Inizieremo con le definizioni fondamentali e la configurazione del tuo ambiente Python. Successivamente, progredirai attraverso la pre-elaborazione delle immagini, l'estrazione del testo OCR, l'etichettatura manuale del testo e l'addestramento del tuo modello NLP personalizzato, concludendo con la strutturazione dei dati estratti. Questo corso è progettato per sviluppatori Python principianti, appassionati di dati e aspiranti ingegneri di machine learning, richiedendo solo una conoscenza di base di Python per iniziare. Inizia a leggere oggi per trasformare le immagini di documenti non strutturati in dati puliti e utilizzabili.

Cosa otterrai

  • 📜 Certificato di completamento
    Aggiungilo al tuo profilo LinkedIn
  • 💬 Tutor AI personale
    Bloccato su una lezione? Chiedi al tuo tutor integrato qualsiasi cosa, in qualsiasi momento.
  • 🎧 Versione audio inclusa
    Impara ovunque, senza schermo
  • ♾️ Accesso a vita
    Torna quando vuoi, senza scadenza
  • 📱 Telefono o computer
    Funziona ovunque, su qualsiasi dispositivo
  • 💸 Rimborso entro 14 giorni
    Senza domande
  • Breve e mirato
    2 h 54 min di contenuto pratico

Certificato di completamento

Ogni corso che completi su PickAClass rilascia una credenziale come questa — originale, con codice proprio, verificabile via URL e dettagliata su ciò che hai dimostrato.

P
PickAClass
Profilo competenze · verificabile
Documento
Certificato di Maestria
Si certifica che
Nome Cognome
ha dimostrato con successo la padronanza di
Estrazione di dati da documenti con OCR e NER personalizzato in Python
Competenze dimostrate
Analisi dei modelli comportamentali
Fondamentale
1.2 h
Framework di architettura decisionale
Competente
1.4 h
Progettazione di test A/B
Competente
1.7 h
Copywriting comportamentale
Avanzato
1.9 h
P
PickAClass — Nome Cognome
Estrazione di dati da documenti con OCR e NER personalizzato in Python
Pagina 2 di 2
Dettaglio prestazioni
Riepilogo del corso
Lezioni completate 14 / 14
Domande di pratica 26 / 28
Compiti consegnati 4 (media 4,5 / 5)
Progetto finale Valutato — 4,6 / 5
Pratica totale 6.2 h
Benchmark di prestazione
Posizione nella coorte Top 12% su 1,625
Tempo al completamento 11 giorni (mediana: 22)
Punteggio di padronanza 91 / 100
Punteggio domande di pratica 94%
Verifica della competenza Percorso di competenza verificato
Verifica questa credenziale
pickaclass.com/certificates/PCC-2026-X4F7-AP19
Emesso secondo gli standard accademici di PickAClass. I livelli di competenza riflettono la prestazione valutata rispetto alla rubrica del corso. È una credenziale originale di questa piattaforma.

Recensioni (2)

Isabella López AR Studente verificato
★ 4 · 25 luglio 2026

Mi è piaciuto molto il flusso di questo. Gli esempi erano sul posto e mi hanno aiutato a cogliere il materiale rapidamente.

Henry White NZ Studente verificato
★ 3 · 1 luglio 2026

Hmm, non sono sicuro che questo sia per principianti assoluti. Assume un po 'di conoscenza precedente che non è stata insegnata esplicitamente.

Scrivi una recensione

Ti chiederemo di accedere dopo l'invio — la bozza viene salvata.

Altri hanno seguito anche

Domande frequenti

Cosa serve per seguire questo corso? +

Basta un telefono o un computer con internet. Niente installazioni, nessun hardware speciale.

Come si paga? +

Con carta via Stripe. Non conserviamo i dati della carta — Stripe li gestisce in sicurezza.

Posso ottenere un rimborso? +

Sì — rimborso completo entro 14 giorni, senza domande.

Per quanto tempo avrò accesso? +

Per sempre. Una volta acquistato, il corso è tuo e puoi rivederlo quando vuoi.

Riceverò un certificato? +

Sì. Al completamento riceverai un certificato da aggiungere al tuo profilo LinkedIn.

Pensato per chi lavora in
Tech Design Finanza Marketing Sanità Istruzione Ospitalità Produzione