ארבע שאלות שחוזרות בראיונות למשרת מהנדס/ת נתונים (Data Engineer), ומה כדאי לענות עליהן.
מעצב את השלבים כ-idempotent כך שאפשר להריץ מחדש בלי ליצור כפילויות, ושומר checkpoint אחרי כל שלב.
streaming כשצריך תובנה כמעט בזמן אמת, batch כשמספיק עדכון פעם ביום וזה פשוט וזול יותר לתחזוקה.
מוסיף בדיקות אוטומטיות על טווחי ערכים ועקביות בין טבלאות כחלק מה-pipeline עצמו.
לפי העמודה הכי נפוצה בשאילתות סינון, בדרך כלל תאריך, כדי לצמצם סריקת נתונים מיותרת.