Mendeploy LLM Lokal: vLLM, Quantization, dan Inference — PickAClass
4.5 (20) ⏱ 3 jam 📚 30 pelajaran 🎧 Versi audio

Mendeploy LLM Lokal: vLLM, Quantization, dan Inference

Pelajari cara mendeploy large language models secara efisien, menerapkan teknik quantization untuk mengurangi kebutuhan perangkat keras, dan menyajikan model di lingkungan produksi.

  • 💬 Instruktur AI
    Tanyakan apa pun tentang pelajaran dan dapatkan jawaban jelas seketika, kapan saja.
  • 🕐 Mulai kapan saja
    Tanpa jadwal atau tenggat — belajar dengan kecepatan sendiri, kapan pun Anda mau.
  • 🌐 Dalam bahasa Indonesia
    Pelajaran, tugas, dan sertifikat — semuanya sepenuhnya dalam bahasa Anda.

Tentang kursus ini

Menjalankan Large Language Models (LLMs) secara lokal atau di produksi bisa tampak menakutkan karena kebutuhan perangkat keras yang masif dan konfigurasi yang kompleks. Seiring AI yang terus berkembang, kemampuan untuk meng-host model Anda sendiri secara efisien menjadi keterampilan penting bagi pengembang dan tim operasional. Kursus ini menguraikan proses deployment dan optimasi LLMs, mengubah Anda dari pemula menjadi seseorang yang mampu menyajikan model AI berperforma tinggi secara efisien. Anda akan mengeksplorasi cara mengurangi jejak memori dan memaksimalkan kecepatan inference menggunakan teknik modern, memastikan Anda dapat menjalankan model yang kuat bahkan dengan sumber daya komputasi yang terbatas. Apa yang akan Anda pelajari: • Memahami konsep dasar arsitektur LLM, inference, dan manajemen memori. • Menghitung kebutuhan perangkat keras dan memperkirakan kebutuhan VRAM GPU untuk berbagai ukuran model. • Menerapkan metode quantization modern seperti GGUF, AWQ, dan GPTQ untuk mengoptimalkan bobot model. • Mengonfigurasi dan mendeploy model menggunakan vLLM untuk inference dengan throughput tinggi dan latensi rendah. • Membuat endpoint REST API standar untuk mengintegrasikan model lokal ke dalam aplikasi Anda dengan mulus. • Berlatih melakukan kontainerisasi deployment LLM Anda menggunakan Docker untuk lingkungan yang konsisten dan skalabel. Perjalanan dimulai dengan terminologi AI yang penting dan dasar-dasar perangkat keras sebelum beralih ke latihan tertulis praktis yang berfokus pada quantization dan deployment. Anda akan maju selangkah demi selangkah melalui skrip konfigurasi dan pola deployment yang digunakan dalam MLOps modern. Dirancang untuk pengembang perangkat lunak, calon insinyur DevOps, dan penggemar teknologi tanpa pengalaman machine learning sebelumnya, panduan berbasis teks ini hanya memerlukan pemahaman dasar tentang konsep pemrograman. Mulailah membaca hari ini untuk membangun keterampilan Anda dalam deployment AI modern dan optimasi inference.

Apa yang Anda dapatkan

  • 📜 Sertifikat penyelesaian
    Tambahkan ke profil LinkedIn Anda
  • 💬 Tutor AI pribadi
    Bingung di tengah pelajaran? Tanya tutor bawaan kamu apa saja, kapan saja.
  • 🎧 Termasuk versi audio
    Belajar di mana saja — tanpa layar
  • ♾️ Akses seumur hidup
    Kembali kapan saja, tanpa kedaluwarsa
  • 📱 Ponsel atau komputer
    Berfungsi di mana saja, perangkat apa saja
  • 💸 Pengembalian 14 hari
    Tanpa pertanyaan
  • Singkat dan fokus
    3 jam konten praktis

Sertifikat penyelesaian

Setiap kursus yang Anda selesaikan di PickAClass menerbitkan kredensial seperti ini — orisinal, dengan kodenya sendiri, dapat diverifikasi via URL, dan rinci tentang yang benar-benar ditunjukkan.

P
PickAClass
Profil keterampilan · terverifikasi
Dokumen
Sertifikat Penguasaan
Ini menyatakan bahwa
Nama Lengkap
telah berhasil menunjukkan penguasaan
Mendeploy LLM Lokal: vLLM, Quantization, dan Inference
Keterampilan yang ditunjukkan
Analisis pola perilaku
Dasar
1.2 jam
Kerangka arsitektur keputusan
Mahir
1.4 jam
Desain uji A/B
Mahir
1.7 jam
Copywriting perilaku
Lanjutan
1.9 jam
P
PickAClass — Nama Lengkap
Mendeploy LLM Lokal: vLLM, Quantization, dan Inference
Halaman 2 dari 2
Detail kinerja
Ringkasan tugas kursus
Pelajaran selesai 14 / 14
Soal latihan 26 / 28
Tugas dikirim 4 (rata 4,5 / 5)
Proyek capstone Ditinjau — 4,6 / 5
Total latihan 6.2 jam
Tolok ukur kinerja
Peringkat kohort 12% teratas dari 1,625
Waktu penyelesaian 11 hari (median: 22)
Skor penguasaan 91 / 100
Skor soal latihan 94%
Verifikasi keterampilan Jalur Keterampilan terverifikasi
Verifikasi kredensial ini
pickaclass.com/certificates/PCC-2026-X4F7-AP19
Diterbitkan di bawah standar akademik PickAClass. Tingkat keterampilan mencerminkan kinerja yang dinilai terhadap rubrik kompetensi kursus. Ini kredensial orisinal platform ini.

Ulasan (20)

Samanthi Rajapakse LK Pelajar terverifikasi
★ 4 · 19.07.2026

Dense but genuinely useful content.

Orhan Sönmez TR Pelajar terverifikasi
★ 5 · 14.07.2026

vLLM ile yerel model dağıtımını ve quantization tekniklerini bu kadar net anlatan başka bir kaynak görmemiştim.

Андрій Бондаренко UA Pelajar terverifikasi
★ 4 · 11.07.2026

Брался за курс, чтобы разобраться с локальным запуском моделей без облака, и в целом цель достигнута. Тема квантизации объяснена понятно: стало ясно, как ужать модель и не угробить качество, чтобы влезть в скромную видеокарту. Развёртывание через vLLM показали по шагам, я поднял свой инференс-сервер и проверил под нагрузкой. Единственное, хотелось бы чуть глубже про мониторинг в продакшене, этот раздел показался коротковатым. Но в остальном материал плотный и применимый сразу. Для тех, кто хочет держать LLM у себя, это отличная отправная точка.

ชัยวัฒน์ รุ่งเรือง TH Pelajar terverifikasi
★ 5 · 10.07.2026

เข้าใจ vLLM และ quantization ง่ายขึ้นมาก

조서윤 KR Pelajar terverifikasi
★ 4 · 03.07.2026

평소에 로컬 LLM을 돌릴 때 GPU 메모리 문제로 계속 막혔었는데, 이 강의를 듣고 나서야 quantization이 실제로 어떻게 작동하는지 감을 잡았습니다. vLLM 설정 과정을 단계별로 따라가면서 PagedAttention 개념까지 자연스럽게 이해가 됐고, 실습 예제도 실제 배포 환경과 비슷하게 구성되어 있어서 도움이 많이 됐습니다. GPTQ와 AWQ 차이를 비교해주는 부분이 특히 유용했는데, 다만 후반부 배치 처리 최적화 설명은 조금 빠르게 지나가서 몇 번 되돌려 봐야 했습니다. 그래도 전체적으로 로컬 배포를 실무 수준으로 끌어올려주는 강의였습니다.

최시우 KR Pelajar terverifikasi
★ 5 · 02.07.2026

vLLM 설치부터 quantization 적용까지 순서대로 따라가기만 하면 되게 구성되어 있어서 좋았습니다. 특히 AWQ와 GPTQ 방식의 차이를 실제 벤치마크로 보여주는 부분이 인상 깊었고, 덕분에 제 프로젝트에 맞는 방법을 바로 골라서 적용할 수 있었습니다.

Sofia Wright AU Pelajar terverifikasi
★ 5 · 02.07.2026

मैंने पहले vLLM को इंस्टॉल करने की कई बार कोशिश की थी लेकिन हमेशा GPU मेमोरी की दिक्कत आ जाती थी, इस कोर्स ने वो पूरी प्रक्रिया कदम दर कदम समझाई। Quantization वाले हिस्से में INT8 और INT4 के बीच का ट्रेडऑफ बहुत साफ तरीके से बताया गया, जिससे यह समझना आसान हो गया कि कब कौन सा तरीका इस्तेमाल करना चाहिए। PagedAttention का कॉन्सेप्ट पहले किताबी लगता था लेकिन यहां प्रैक्टिकल उदाहरण से समझ आ गया। सर्विंग API सेटअप करने वाला हिस्सा भी असली प्रोडक्शन जैसा फील देता है, सिर्फ थ्योरी नहीं। कुल मिलाकर अब मैं अपने खुद के मॉडल को लोकली डिप्लॉय करने में कॉन्फिडेंट महसूस करता हूं।

Hava Akın TR Pelajar terverifikasi
★ 4 · 30.06.2026

Quantization kısmı çok faydalıydı ama vLLM'in production ortamına ölçeklendirilmesiyle ilgili örnekler biraz daha fazla olabilirdi.

David Osei GH Pelajar terverifikasi
★ 5 · 26.06.2026

The quantization comparisons alone saved me hours of trial and error trying to fit a model onto my GPU.

Petre Dinu RO Pelajar terverifikasi
★ 5 · 25.06.2026

Finally got vLLM running smoothly.

Makeda Solomon ET Pelajar terverifikasi
★ 4 · 21.06.2026

Practical and hands-on, though it assumes you're already comfortable with basic GPU setup before diving into vLLM.

Alessandro Romano IT Pelajar terverifikasi
★ 4 · 17.06.2026

Avevo già provato a configurare vLLM da solo un paio di volte senza grandi risultati, quindi questo corso è arrivato al momento giusto. La parte sulla quantizzazione, in particolare il confronto tra le varie tecniche per ridurre l'uso di memoria della GPU, è spiegata con esempi concreti e non solo teoria. Anche il capitolo su PagedAttention mi ha aiutato a capire perché certi modelli locali erano così lenti prima. L'unico neo è che la sezione finale sul batching dinamico va un po' di fretta e avrei voluto qualche esempio in più. Nel complesso però sono riuscito a far girare un modello locale con prestazioni decisamente migliori di prima.

Papp Attila HU Pelajar terverifikasi
★ 4 · 17.06.2026

Good practical walkthrough of quantization tradeoffs, though the throughput benchmarking section could use more depth.

Endale Yosef ET Pelajar terverifikasi
★ 4 · 15.06.2026

The walkthrough on quantizing models with AWQ actually made the memory savings click for me instead of just being a buzzword. Setting up vLLM locally went a lot smoother following the instructor's config choices than when I tried it on my own before. The only gap is the course doesn't spend much time on multi-GPU serving, which I would have liked.

Tiago Martins PT Pelajar terverifikasi
★ 4 · 06.06.2026

Bom curso, mas rápido demais no batching.

Nguyễn Văn Phát VN Pelajar terverifikasi
★ 5 · 04.06.2026

Khóa học giải thích rất rõ cách triển khai vLLM và áp dụng quantization để giảm bộ nhớ GPU mà vẫn giữ tốc độ suy luận ổn định.

Aiman Hakim bin Mohd Yusof MY Pelajar terverifikasi
★ 5 · 03.06.2026

Kursus ini menerangkan dengan jelas cara guna vLLM dan quantization untuk deploy LLM secara tempatan tanpa memerlukan GPU yang terlalu besar.

Viviane Carvalho BR Pelajar terverifikasi
★ 5 · 03.06.2026

O curso mostra na prática como configurar o vLLM e aplicar quantização sem transformar isso num mar de teoria abstrata. Gostei bastante de como a parte de PagedAttention foi explicada com desenhos simples que finalmente fizeram sentido pra mim. Depois de terminar consegui rodar um modelo local com uma latência bem menor do que antes.

Sobia Khan PK Pelajar terverifikasi
★ 5 · 01.06.2026

Made local deployment actually make sense.

Sofia Cruz PH Pelajar terverifikasi
★ 4 · 27.05.2026

Malinaw ang paliwanag sa pag-deploy gamit ang vLLM, pero sana mas detalyado pa sa paghahambing ng GPTQ at AWQ quantization.

Tulis ulasan

Setelah mengirim kami akan meminta masuk — draf Anda tersimpan.

Pelajar lain juga mengambil

Pertanyaan umum

Apa yang saya butuhkan untuk mengikuti kursus ini? +

Cukup ponsel atau komputer dengan internet. Tidak ada instalasi atau perangkat khusus.

Bagaimana cara membayar? +

Dengan kartu via Stripe. Kami tidak menyimpan detail kartu — Stripe menanganinya dengan aman.

Bisakah saya mendapat refund? +

Ya — refund penuh dalam 14 hari, tanpa pertanyaan.

Berapa lama saya akan punya akses? +

Selamanya. Setelah membeli, kursus jadi milik Anda untuk dikunjungi lagi kapan saja.

Apakah saya akan mendapat sertifikat? +

Ya. Setelah selesai, Anda akan menerima sertifikat yang bisa ditambahkan ke profil LinkedIn.

Dibuat untuk pelajar di
Teknologi Desain Keuangan Pemasaran Kesehatan Pendidikan Perhotelan Manufaktur