Costruire App AI Multimodali: Speech-to-Text e LLMs — PickAClass
4.6 (12) ⏱ 2 h 42 min 📚 27 lezioni

Costruire App AI Multimodali: Speech-to-Text e LLMs

Una guida adatta ai principianti per sviluppatori per integrare il riconoscimento vocale, l'analisi delle immagini e gli LLMs multimodali in applicazioni moderne utilizzando API standard e pattern AI attuali.

  • 💬 Istruttore IA
    Fai domande su qualsiasi lezione e ricevi una risposta chiara all'istante, quando vuoi.
  • 🕐 Inizia quando vuoi
    Niente orari né scadenze: impara al tuo ritmo, quando vuoi.
  • 🌐 In italiano
    Lezioni, esercizi e certificato: tutto interamente nella tua lingua.

Informazioni sul corso

Le applicazioni moderne stanno andando oltre il semplice testo. Integrando capacità di elaborazione vocale, di immagini e video, gli sviluppatori possono creare esperienze utente altamente interattive e intelligenti. Questo corso fornisce una comprensione fondamentale dei Large Language Models (LLMs) multimodali e delle tecnologie speech-to-text. Imparerai a scrivere codice che interagisce con i modelli AI per trascrivere audio, analizzare dati visivi e generare risposte intelligenti, trasformando applicazioni standard in potenti strumenti guidati dall'AI. Cosa imparerai: Comprendere i concetti fondamentali dell'AI multimodale e come i modelli elaborano diversi tipi di dati; Scrivere codice per integrare API speech-to-text per una trascrizione audio accurata; Elaborare e analizzare immagini e fotogrammi video utilizzando le moderne capacità degli LLM; Applicare tecniche fondamentali di prompt engineering su misura per input multimodali; Implementare pattern di base di Retrieval-Augmented Generation (RAG) per rich media; Costruire script basati su testo che orchestrano flussi di lavoro AI complessi in modo fluido. Il curriculum inizia con la terminologia AI essenziale e i concetti fondamentali prima di passare all'integrazione pratica delle API e alla gestione dei dati. Progredirai attraverso lezioni scritte strutturate e snippet di codice che aumenteranno la tua sicurezza nella gestione programmatica di vari tipi di media. Questo corso è progettato per sviluppatori principianti e ingegneri fullstack che desiderano entrare nel settore dell'AI senza che sia richiesta una precedente esperienza di machine learning. Inizia a leggere oggi per sbloccare il potenziale dell'AI multimodale nel tuo prossimo progetto di sviluppo.

Cosa otterrai

  • 📜 Certificato di completamento
    Aggiungilo al tuo profilo LinkedIn
  • 💬 Tutor AI personale
    Bloccato su una lezione? Chiedi al tuo tutor integrato qualsiasi cosa, in qualsiasi momento.
  • ♾️ Accesso a vita
    Torna quando vuoi, senza scadenza
  • 📱 Telefono o computer
    Funziona ovunque, su qualsiasi dispositivo
  • 💸 Rimborso entro 14 giorni
    Senza domande
  • Breve e mirato
    2 h 42 min di contenuto pratico

Certificato di completamento

Ogni corso che completi su PickAClass rilascia una credenziale come questa — originale, con codice proprio, verificabile via URL e dettagliata su ciò che hai dimostrato.

P
PickAClass
Profilo competenze · verificabile
Documento
Certificato di Maestria
Si certifica che
Nome Cognome
ha dimostrato con successo la padronanza di
Costruire App AI Multimodali: Speech-to-Text e LLMs
Competenze dimostrate
Analisi dei modelli comportamentali
Fondamentale
1.2 h
Framework di architettura decisionale
Competente
1.4 h
Progettazione di test A/B
Competente
1.7 h
Copywriting comportamentale
Avanzato
1.9 h
P
PickAClass — Nome Cognome
Costruire App AI Multimodali: Speech-to-Text e LLMs
Pagina 2 di 2
Dettaglio prestazioni
Riepilogo del corso
Lezioni completate 14 / 14
Domande di pratica 26 / 28
Compiti consegnati 4 (media 4,5 / 5)
Progetto finale Valutato — 4,6 / 5
Pratica totale 6.2 h
Benchmark di prestazione
Posizione nella coorte Top 12% su 1,625
Tempo al completamento 11 giorni (mediana: 22)
Punteggio di padronanza 91 / 100
Punteggio domande di pratica 94%
Verifica della competenza Percorso di competenza verificato
Verifica questa credenziale
pickaclass.com/certificates/PCC-2026-X4F7-AP19
Emesso secondo gli standard accademici di PickAClass. I livelli di competenza riflettono la prestazione valutata rispetto alla rubrica del corso. È una credenziale originale di questa piattaforma.

Recensioni (12)

مريم بنت أحمد بن راشد آل ثاني QA Studente verificato
★ 4 · 24 luglio 2026

شرح جيد لكن سريع بعض الشيء.

Cemile Karaca TR Studente verificato
★ 5 · 22 luglio 2026

Konuşmayı metne çevirip multimodal LLM'e bağladığım ilk uygulamayı kurmak şaşırtıcı derecede kolaydı, başlangıç için harika.

Esi Adu GH Studente verificato
★ 5 · 14 luglio 2026

Really practical intro to combining speech-to-text with an LLM, and the pacing between audio and image sections feels well balanced.

Pablo Ruiz ES Studente verificato
★ 4 · 6 luglio 2026

Bien explicado, aunque algo denso al final.

Lina Marlina ID
★ 5 · 4 luglio 2026

Panduan integrasi speech-to-text dan LLM-nya sangat mudah diikuti untuk pemula, langsung praktik bikin fitur multimodal dari awal.

Hava Akın TR
★ 4 · 26 giugno 2026

Ses tanıma kısmı gerçekten iyi anlatılmış.

吉田 葵 JP Studente verificato
★ 5 · 25 giugno 2026

音声認識とLLMを組み合わせてマルチモーダルなアプリを作る流れが、初心者でも迷わないくらい丁寧に説明されています。

Henry Walker AU
★ 4 · 18 giugno 2026

Nice walkthrough of hooking speech-to-text into an LLM pipeline, though the image portion feels a bit rushed compared to the audio section.

Isabella Herrera PA
★ 4 · 15 giugno 2026

Speech recognition को LLM के साथ जोड़ने का तरीका बहुत साफ तरीके से समझाया गया है, बस image वाला हिस्सा थोड़ा और डिटेल में हो सकता था।

Fernanda Mendes BR
★ 5 · 12 giugno 2026

O curso mostra bem como conectar reconhecimento de fala a um LLM para montar um app multimodal do zero. Gostei especialmente da parte prática, onde você grava um áudio e vê o modelo respondendo em tempo real.

Peter Petersen DK Studente verificato
★ 5 · 3 giugno 2026

Clear intro to multimodal AI basics.

Renata Flores UY
★ 5 · 26 maggio 2026

Me sorprendió lo accesible que resulta combinar reconocimiento de voz con un modelo de lenguaje después de este curso. Va construyendo la app multimodal pieza por pieza, primero el audio, luego cómo pasarlo al LLM, y se entiende perfectamente incluso sin experiencia previa en IA.

Scrivi una recensione

Ti chiederemo di accedere dopo l'invio — la bozza viene salvata.

Altri hanno seguito anche

Domande frequenti

Cosa serve per seguire questo corso? +

Basta un telefono o un computer con internet. Niente installazioni, nessun hardware speciale.

Come si paga? +

Con carta via Stripe. Non conserviamo i dati della carta — Stripe li gestisce in sicurezza.

Posso ottenere un rimborso? +

Sì — rimborso completo entro 14 giorni, senza domande.

Per quanto tempo avrò accesso? +

Per sempre. Una volta acquistato, il corso è tuo e puoi rivederlo quando vuoi.

Riceverò un certificato? +

Sì. Al completamento riceverai un certificato da aggiungere al tuo profilo LinkedIn.

Pensato per chi lavora in
Tech Design Finanza Marketing Sanità Istruzione Ospitalità Produzione