Informazioni sul corso
Colmare il divario tra vedere e descrivere è una delle sfide più eccitanti nella moderna intelligenza artificiale.Questo corso fornisce un percorso chiaro per capire come le macchine interpretano i dati visivi e li traducono in un linguaggio umano significativo. Esplorerai l'intersezione della visione artificiale e dell'elaborazione del linguaggio naturale per costruire sistemi in grado di comprendere il contesto di un'immagine.
Alla fine di questo corso, sarai in grado di progettare, addestrare e valutare modelli che producono descrizioni accurate per vari input visivi, come immagini, video, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagini, immagin
Cosa imparerai:
- Comprendere i concetti fondamentali del deep learning multimodale e delle reti neurali.
- Costruisci architetture encoder-decoder utilizzando strutture convoluzionali e ricorrenti.
- Applicare meccanismi di attenzione per aiutare i modelli a concentrarsi su parti specifiche di un'immagine durante la generazione del testo.
- Implementare moderne tecniche basate su Transformer per migliorare le prestazioni dei sottotitoli.
- Pratica l'estrazione delle funzionalità delle immagini e la preelaborazione del testo per le pipeline di apprendimento automatico.
- Valuta la qualità del modello utilizzando metriche standard del settore come BLEU e CIDEr.
Il corso inizia con le definizioni essenziali e la storia della tecnologia image-to-text prima di passare alle componenti tecniche dell'architettura del modello.Poi progredirai attraverso il ciclo di vita della formazione, dalla preparazione dei dati alla messa a punto e alla valutazione delle prestazioni.
Questo corso è progettato per i principianti interessati all'intelligenza artificiale e all'apprendimento automatico.Non è richiesta alcuna esperienza precedente con la visione artificiale o la modellazione complessa per iniziare.
Inizia a costruire i tuoi sistemi di descrizione delle immagini intelligenti oggi.