אחראי/ת על SLO/SLA של שירותים קריטיים, בונה דשבורדים ל-observability ומוביל postmortems אחרי כל תקלה משמעותית. בחברת תשתית ישראלית נמצא בסבב on-call ומגיב לאירועים בזמן אמת.
פסקת פתיחה לדוגמה
מהנדס/ת SRE עם ניסיון בניהול זמינות ותקלות בקנה מידה גדול
שורות הישג עם מספרים
העלאת זמינות שירות ליבה מ-99.5% ל-99.95% תוך שנה
הורדת MTTR מ-120 דקות ל-20 דקות דרך שיפור runbooks
הובלת 30+ postmortems ללא האשמה, עם action items שיושמו במלואם
צמצום כמות ההתראות השבועיות מ-200 ל-40 דרך כיוון סף נכון
כישורים שכדאי לציין
הגדרת SLO/SLI
observability (metrics, logs, traces)
ניהול incident response
כתיבת runbooks
capacity planning
אוטומציה עם Python/Go
ניהול Kubernetes בפרודקשן
כתיבת פוסטמורטמים
מערכות וכלים
Prometheus/Grafana
PagerDuty
Kubernetes
Datadog
Terraform
טעויות נפוצות בקורות חיים למהנדס/ת אמינות מערכות (SRE)
כתיבת 'ניסיון ב-on-call' בלי לציין SLA או תקן זמינות שנשמר