0Pricing
Python Academy · درس

تنظيف البيانات والمعالجة المسبقة

افهم كيفية التعامل مع البيانات المفقودة وإزالة التكرارات ومعالجة البيانات الأولية مسبقًا للتحليل

تنظيف البيانات والمعالجة المسبقة درس مجاني في Python Academy على CoddyKit. هذا هو الدرس 4 من أصل 5. يمكنك قراءة الدرس كاملاً أدناه مجاناً — ثم تمرن عليه مباشرة في المتصفح باستخدام محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7. هذا الدرس جزء من مسار التعلم في Python Academy، وتقدمك يتزامن عبر الويب وتطبيق CoddyKit. تتضمن دورة Python Academy 5 دروس في المجموع.

نظرة عامة على تنظيف البيانات

تنظيف البيانات ومعالجتها مسبقًا

غالبًا ما تكون البيانات الأولية غير منظمة، وتحتاج إلى التنظيف والمعالجة المسبقة قبل تحليلها. وتُعد هذه الخطوات ضرورية لضمان جودة تحليلكم ودقته.

في هذا الدرس، ستتعلمون تقنيات معالجة البيانات المفقودة وإزالة التكرارات وإعداد البيانات للتحليل.

تنظيف البيانات والمعالجة المسبقة — رسم توضيحي 1

ما تنظيف البيانات؟

ما تنظيف البيانات؟

يتضمن تنظيف البيانات اكتشاف الأخطاء في مجموعة البيانات وإصلاحها. وتشمل المهام الشائعة ما يلي:

  • معالجة القيم المفقودة.
  • إزالة التكرارات.
  • توحيد التنسيقات.

معالجة البيانات المفقودة

معالجة البيانات المفقودة

قد تحدث البيانات المفقودة لأسباب مختلفة. ويمكنكم معالجتها من خلال:

  • ملء القيم المفقودة بقيمة افتراضية أو بالمتوسط أو الوسيط.
  • حذف الصفوف أو الأعمدة التي تحتوي على عدد كبير جدًا من القيم المفقودة.
# Example: Handling missing data
import pandas as pd

data = {'Name': ['Alice', 'Bob', None], 'Age': [25, None, 30]}
df = pd.DataFrame(data)
df['Age'].fillna(df['Age'].mean(), inplace=True)
print(df)

إزالة التكرارات

إزالة التكرارات

قد تؤدي البيانات المكررة إلى تحريف تحليلكم. استخدموا Pandas لإزالة التكرارات:

# Example: Removing duplicates
data = {'Name': ['Alice', 'Bob', 'Alice'], 'Age': [25, 30, 25]}
df = pd.DataFrame(data)
df = df.drop_duplicates()
print(df)

توحيد البيانات

توحيد البيانات

يضمن توحيد البيانات الاتساق. فعلى سبيل المثال، يمكنكم توحيد تنسيقات التواريخ أو حالة الأحرف في النص:

# Example: Standardizing text case
data = {'Name': ['Alice', 'BOB', 'alice']}
df = pd.DataFrame(data)
df['Name'] = df['Name'].str.capitalize()
print(df)

تحويل البيانات

تحويل البيانات

تُعد التحويلات مثل تغيير المقياس والترميز جزءًا من المعالجة المسبقة:

  • تغيير المقياس: توحيد القيم العددية.
  • الترميز: تحويل البيانات الفئوية إلى صيغة عددية.
# Example: Encoding categorical data
from sklearn.preprocessing import LabelEncoder

data = {'Category': ['A', 'B', 'A']}
df = pd.DataFrame(data)
encoder = LabelEncoder()
df['Category'] = encoder.fit_transform(df['Category'])
print(df)

تحجيم البيانات

تحجيم البيانات

يضمن التحجيم أن تكون البيانات الرقمية على المقياس نفسه، وهذا أمر ضروري لخوارزميات التعلم الآلي:

# Example: Scaling data
from sklearn.preprocessing import StandardScaler

values = [[10], [20], [30]]
scaler = StandardScaler()
scaled_values = scaler.fit_transform(values)
print(scaled_values)

التحقق من صحة البيانات

التحقق من صحة البيانات

يضمن التحقق من الصحة استيفاء البيانات لمعايير الجودة. فعلى سبيل المثال، تحقّقوا من القيم الشاذة أو القيم غير الصالحة:

# Example: Validating data
import numpy as np

data = [10, 20, 1000]  # 1000 might be an outlier
mean = np.mean(data)
std_dev = np.std(data)
outliers = [x for x in data if abs(x - mean) > 2 * std_dev]
print("Outliers:", outliers)

الأخطاء الشائعة في تنظيف البيانات

الأخطاء الشائعة في تنظيف البيانات

إليكم بعض الأخطاء التي ينبغي تجنّبها:

  • تجاهل البيانات المفقودة، مما يؤدي إلى تحليل غير دقيق.
  • عدم توحيد التنسيقات، مما يسبب عدم الاتساق.
  • إغفال التحقق من الصحة، مما يؤدي إلى حدوث أخطاء في المهام اللاحقة.

ماذا تعلّمنا؟

ماذا تعلّمنا؟

في هذا الدرس، تعلّمتم:

  • كيفية التعامل مع البيانات المفقودة وإزالة التكرارات.
  • كيفية توحيد البيانات وتحويلها وتحجيمها لأغراض التحليل.
  • كيفية التحقق من جودة البيانات وتحديد القيم الشاذة.
  • أهمية تنظيف البيانات للحصول على تحليل دقيق.

أحسنتم! لننتقل إلى الموضوع التالي.

تنظيف البيانات والمعالجة المسبقة — رسم توضيحي 11

الأسئلة الشائعة

هل درس «تنظيف البيانات والمعالجة المسبقة» مجاني؟

نعم — نص درس «تنظيف البيانات والمعالجة المسبقة» كامل متاح مجاناً هنا على الويب. لتمرينه بشكل تفاعلي (محرر أكواد مدمج ومدرس ذكاء اصطناعي متاح 24/7) وفتح باقي دورة Python Academy، انتقل إلى CoddyKit PRO. تتضمن دورة Python Academy 5 دروس في المجموع.

ماذا ستتعلم في «تنظيف البيانات والمعالجة المسبقة»؟

افهم كيفية التعامل مع البيانات المفقودة وإزالة التكرارات ومعالجة البيانات الأولية مسبقًا للتحليل تتمرن على Python Academy مع أكواد عملية تشغلها مباشرة في المتصفح، ومدرس ذكاء اصطناعي متاح 24/7 يجيب على أسئلتك أثناء عملك.

هل أحتاج إلى خبرة سابقة لأبدأ Python Academy؟

لا تُشترط خبرة سابقة. Python Academy على CoddyKit منظم للمبتدئين حتى المتقدمين، لذا يمكنك البدء من هنا أو من البداية والتقدم بسرعتك الخاصة. هذا هو الدرس 4 من أصل 5.

كم من الوقت يستغرق درس «تنظيف البيانات والمعالجة المسبقة»؟

معظم دروس CoddyKit تستغرق حوالي 5–10 دقائق. كل منها موجز وتفاعلي، لذا تحرز تقدماً مستمراً وتستأنف من حيث توقفت عبر الويب والتطبيق.

هل يمكنني كتابة وتشغيل أكواد في درس Python Academy هذا؟

نعم. كل درس في Python Academy يتضمن محرر أكواد مدمج، لذا تكتب وتشغل أكواداً حقيقية مباشرة في متصفحك وتحصل على تعليقات فورية من الذكاء الاصطناعي — بدون إعداد محلي.

جميع الدروس في هذه الدورة

  1. ما هو علم البيانات؟
  2. دور Python في علم البيانات
  3. هياكل البيانات لعلم البيانات
  4. تنظيف البيانات والمعالجة المسبقة
  5. تحليل البيانات الاستكشافي (EDA)
← العودة إلى Python Academy