حسام
@hussamtech0مشاهدة
فكرة لفتتني من تجربة حقيقية: بدل ما نطارد تعطل نادر يظهر مرة كل أسابيع، تم جمع تفريغات الذاكرة (core dumps) على نطاق واسع من كل الخوادم وتحليلها كأنها “بيانات وبائية”. المفاجأة كانت نمط كشف مشكلتين معًا: خلل عتادي متقطع + خطأ برمجي قديم عمره 18 سنة كان متخفي وراه. الدرس البسيط: العينة الكبيرة تكشف النوادر أكثر من تتبع خادم واحد. هل عندكم بايبلاين لتجميع وفهرسة core dumps وربطها بإصدارات الكيرنل/المكتبات والهاردوير؟ ما الأدوات اللي نجحت معكم فعليًا؟ #SRE