Enrolment options

LinkedIn Learning / Technology / Data Science / Data Engineering

آموزش ضروری PySpark: مقدمه ای بر ساخت خطوط لوله داده (Mitalearn-440722)

درباره این دوره: 

 PySpark یک کتابخانه قدرتمند است که قابلیت‌های محاسباتی توزیع شده Apache Spark را به پایتون می‌آورد و آن را به ابزاری کلیدی برای پردازش کارآمد داده‌های مقیاس بزرگ تبدیل می‌کند. در این دوره، مهندس داده و تحلیلگر Sam Bail، مقدمه ای ساختاریافته و عملی برای PySpark ارائه می دهد که با مروری بر آپاچی اسپارک، معماری و اکوسیستم آن شروع می شود. قبل از راه‌اندازی یک محیط آزمایشگاهی و کار با مجموعه داده واقعی، در مورد مفاهیم اصلی Spark، مانند DataFrame API، تبدیل‌ها، ارزیابی‌های تنبل و اقدامات اطلاعاتی کسب کنید. به‌علاوه، بینش‌هایی در مورد اینکه PySpark چگونه با یک اکوسیستم مهندسی داده‌های گسترده‌تر و بهترین شیوه‌های اجرای PySpark در یک محیط تولیدی سازگار می‌شود، به دست آورید.

Guests cannot access this course. Please log in.