ההדף הראשון
פיתוח תוכנה

קורות חיים למהנדס/ת אמינות מערכות (SRE)

אחראי/ת על SLO/SLA של שירותים קריטיים, בונה דשבורדים ל-observability ומוביל postmortems אחרי כל תקלה משמעותית. בחברת תשתית ישראלית נמצא בסבב on-call ומגיב לאירועים בזמן אמת.

פסקת פתיחה לדוגמה

מהנדס/ת SRE עם ניסיון בניהול זמינות ותקלות בקנה מידה גדול

שורות הישג עם מספרים

  • העלאת זמינות שירות ליבה מ-99.5% ל-99.95% תוך שנה
  • הורדת MTTR מ-120 דקות ל-20 דקות דרך שיפור runbooks
  • הובלת 30+ postmortems ללא האשמה, עם action items שיושמו במלואם
  • צמצום כמות ההתראות השבועיות מ-200 ל-40 דרך כיוון סף נכון

כישורים שכדאי לציין

  • הגדרת SLO/SLI
  • observability (metrics, logs, traces)
  • ניהול incident response
  • כתיבת runbooks
  • capacity planning
  • אוטומציה עם Python/Go
  • ניהול Kubernetes בפרודקשן
  • כתיבת פוסטמורטמים

מערכות וכלים

  • Prometheus/Grafana
  • PagerDuty
  • Kubernetes
  • Datadog
  • Terraform

טעויות נפוצות בקורות חיים למהנדס/ת אמינות מערכות (SRE)

  • כתיבת 'ניסיון ב-on-call' בלי לציין SLA או תקן זמינות שנשמר
  • לא מבדילים בין תפקיד SRE לתפקיד DevOps רגיל
  • השמטת אזכור מדדי MTTR או מספר אירועים שטופלו

מקצועות קרובים