تنظيف البيانات والمعالجة المسبقة
افهموا كيفية التعامل مع البيانات المفقودة وإزالة التكرارات ومعالجة البيانات الخام مسبقًا للتحليل
تنظيف البيانات والمعالجة المسبقة درس مجاني في Python For Kids على CoddyKit. هذا هو الدرس 4 من أصل 5. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Python For Kids، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Python For Kids 5 دروس في المجموع.
نظرة عامة على تنظيف البيانات
تنظيف البيانات ومعالجتها مسبقًا
غالبًا ما تكون البيانات الأولية غير منظمة، وتحتاج إلى التنظيف والمعالجة المسبقة قبل تحليلها. وتُعد هذه الخطوات ضرورية لضمان جودة تحليلك ودقته.
في هذا الدرس، ستتعلم تقنيات التعامل مع البيانات المفقودة وإزالة التكرارات ومعالجة البيانات مسبقًا لتحليلها.

ما تنظيف البيانات؟
يتضمن تنظيف البيانات تحديد الأخطاء في مجموعة البيانات وإصلاحها. وتشمل المهام الشائعة ما يلي:
- معالجة القيم المفقودة.
- إزالة التكرارات.
- توحيد التنسيقات.
التعامل مع البيانات المفقودة
قد تحدث البيانات المفقودة لأسباب مختلفة. ويمكنكم التعامل معها من خلال:
- ملء القيم المفقودة بقيمة افتراضية أو بالمتوسط/الوسيط.
- حذف الصفوف أو الأعمدة التي تحتوي على عدد كبير جدًا من القيم المفقودة.
# Example: Handling missing data
import pandas as pd
data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)إزالة التكرارات
قد تؤثر البيانات المكررة سلبًا في تحليلكم. استخدموا Pandas لإزالة التكرارات:
# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)توحيد البيانات
يضمن توحيد البيانات اتساقها. فعلى سبيل المثال، يمكنكم توحيد تنسيقات التاريخ أو حالة الأحرف في النص:
# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)تحويل البيانات
تُعد التحويلات، مثل التحجيم والترميز، جزءًا من المعالجة المسبقة:
- التحجيم: توحيد القيم الرقمية.
- الترميز: تحويل البيانات الفئوية إلى صيغة رقمية.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder
data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)تحجيم البيانات
يضمن التحجيم أن تكون البيانات الرقمية على المقياس نفسه، وهو أمر ضروري لخوارزميات تعلّم الآلة:
# Example: Scaling data
from sklearn.preprocessing import StandardScaler
values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)التحقق من صحة البيانات
يضمن التحقق من صحة البيانات استيفاءها لمعايير الجودة. فعلى سبيل المثال، تحققوا من القيم الشاذة أو القيم غير الصالحة:
# Example: Validating data
import numpy as np
data = [10, 20, 1000] # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)الأخطاء الشائعة في تنظيف البيانات
إليكم بعض الأخطاء التي ينبغي تجنبها:
- تجاهل البيانات المفقودة، مما يؤدي إلى تحليل غير دقيق.
- عدم توحيد التنسيقات، مما يسبب حالات من عدم الاتساق.
- إغفال التحقق من صحة البيانات، مما يؤدي إلى أخطاء في المهام اللاحقة.
ماذا تعلمتم؟
في هذا الدرس، تعلمتم:
- كيفية التعامل مع البيانات المفقودة وإزالة التكرارات.
- كيفية توحيد البيانات وتحويلها وتحجيمها لأغراض التحليل.
- كيفية التحقق من جودة البيانات وتحديد القيم الشاذة.
- أهمية تنظيف البيانات لإجراء تحليل دقيق.
أحسنتم! لننتقل إلى الموضوع التالي.

تعلم Python مع معلم ذكاء اصطناعي — مجانًا
اكتب وقم بتشغيل أكوادك الفعلية في المتصفح، واحصل على مساعدة فورية من معلم ذكاء اصطناعي متاح 24/7، واستمر من حيث توقفت على الويب أو في التطبيق.
- الدورات
- 22
- الدروس
- 94
الأسئلة الشائعة
هل درس «تنظيف البيانات والمعالجة المسبقة» مجاني؟
نعم — نص درس «تنظيف البيانات والمعالجة المسبقة» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Python For Kids، انتقل إلى CoddyKit PRO. تتضمن دورة Python For Kids 5 دروس في المجموع.
ماذا ستتعلم في «تنظيف البيانات والمعالجة المسبقة»؟
افهموا كيفية التعامل مع البيانات المفقودة وإزالة التكرارات ومعالجة البيانات الخام مسبقًا للتحليل تتمرن على Python For Kids مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.
هل أحتاج إلى خبرة سابقة لأبدأ Python For Kids؟
لا تُشترط خبرة سابقة. Python For Kids على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 4 من أصل 5.
كم من الوقت يستغرق درس «تنظيف البيانات والمعالجة المسبقة»؟
معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.
هل يمكنني كتابة وتشغيل أكواد في درس Python For Kids هذا؟
نعم. كل درس في Python For Kids يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.
جميع الدروس في هذه الدورة
- ما هو علم البيانات؟
- دور Python في علم البيانات
- هياكل البيانات لعلم البيانات
- تنظيف البيانات والمعالجة المسبقة
- تحليل البيانات الاستكشافي (EDA)