Основы Series и DataFrame
Создавайте и исследуйте структуры данных Pandas из различных источников.
«Основы Series и DataFrame» — бесплатный урок Python Academy на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python Academy содержит 4 уроков всего.
Что такое Pandas
Pandas предоставляет Series (одномерный массив с метками) и DataFrame (двумерную таблицу с метками), построенные на NumPy и оптимизированные для анализа данных.
import pandas as pd
s = pd.Series([10, 20, 30], index=["a","b","c"])
print(s)
# a 10
# b 20
# c 30Создание Series
Создайте Series из списка, словаря или скаляра. По умолчанию индексом служат целые числа, начинающиеся с нуля.
import pandas as pd
# From list:
s1 = pd.Series([1, 2, 3])
# From dict (keys become index):
s2 = pd.Series({"x": 10, "y": 20})
# Scalar (broadcast):
s3 = pd.Series(5, index=range(4))
print(s3) # 0 5 / 1 5 / 2 5 / 3 5Создание DataFrame
Создайте DataFrame из словаря списков, списка словарей или массива NumPy.
import pandas as pd
df = pd.DataFrame({
"name": ["Alice","Bob","Carol"],
"age": [30, 25, 35],
"score":[95.5, 87.0, 92.3]
})
print(df)Базовая проверка
head(), tail(), shape, dtypes, info(), describe() — первые шаги при работе с любым новым набором данных.
import pandas as pd
df = pd.read_csv("data.csv")
print(df.head()) # first 5 rows
print(df.shape) # (rows, cols)
print(df.dtypes) # column types
print(df.describe()) # count, mean, std, min...Доступ к столбцам
Получайте доступ к столбцу с помощью точечной нотации или квадратных скобок. Точечная нотация не работает для имён столбцов с пробелами или имён, совпадающих с атрибутами DataFrame.
import pandas as pd
df = pd.DataFrame({"age":[30,25], "city":["NY","LA"]})
print(df["age"]) # preferred
print(df.age) # also works if name is simple
print(df[["age","city"]]) # multiple columnsОсновы индекса
Индекс обозначает строки. По умолчанию используются значения 0, 1, 2... но в качестве индекса можно задать любые хешируемые значения.
import pandas as pd
df = pd.DataFrame({"val":[10,20,30]}, index=["a","b","c"])
print(df.loc["b"]) # row with label b
print(df.index) # Index(['a','b','c'])
# Reset to default integer index:
df.reset_index(drop=True, inplace=True)Добавление и удаление столбцов
Чтобы добавить столбец, присвойте значение новому ключу. Для удаления столбца используйте drop().
import pandas as pd
df = pd.DataFrame({"a":[1,2,3],"b":[4,5,6]})
df["c"] = df["a"] + df["b"] # new column
df.drop(columns=["b"], inplace=True)
print(df)Выравнивание Series
При объединении Series Pandas выравнивает данные по индексу. Если соответствие не найдено, появляется NaN.
import pandas as pd
s1 = pd.Series([1,2,3], index=["a","b","c"])
s2 = pd.Series([10,20], index=["b","c"])
print(s1 + s2)
# a NaN
# b 12.0
# c 23.0to_dict и to_list
Преобразуйте DataFrame или Series обратно в стандартные структуры Python для экспорта или просмотра.
import pandas as pd
df = pd.DataFrame({"x":[1,2],"y":[3,4]})
print(df.to_dict("records"))
# [{'x': 1, 'y': 3}, {'x': 2, 'y': 4}]
print(df["x"].to_list())
# [1, 2]Чтение файлов
Pandas напрямую загружает CSV, Excel, JSON, Parquet и данные SQL в DataFrames.
import pandas as pd
df_csv = pd.read_csv("data.csv")
df_excel = pd.read_excel("data.xlsx", sheet_name="Sheet1")
df_json = pd.read_json("data.json")
df_parq = pd.read_parquet("data.parquet")
# pd.read_sql("SELECT * FROM table", conn)Запись файлов
Экспортируйте DataFrames в CSV, Excel, JSON и Parquet.
import pandas as pd
df = pd.DataFrame({"a":[1,2],"b":[3,4]})
df.to_csv("out.csv", index=False)
df.to_json("out.json", orient="records")
df.to_parquet("out.parquet")Быстрая проверка
Что возвращает df.describe()?
Итоги
Series — это одномерный массив с метками, а DataFrame — двумерная таблица с метками. Получайте доступ к столбцам с помощью df["col"]. Используйте head(), describe(), info() для быстрого просмотра. Читайте и записывайте CSV, Excel, JSON и Parquet с помощью встроенных функций.
Часто задаваемые вопросы
Урок «Основы Series и DataFrame» бесплатный?
Да — полный текст урока «Основы Series и DataFrame» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python Academy, подпишись на CoddyKit PRO. Курс Python Academy содержит 4 уроков всего.
Чему я научусь в уроке «Основы Series и DataFrame»?
Создавайте и исследуйте структуры данных Pandas из различных источников. Ты практикуешь Python Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Python Academy?
Предыдущий опыт не требуется. Python Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Основы Series и DataFrame»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Python Academy?
Да. Каждый урок Python Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Основы Series и DataFrame
- Индексация, фильтрация и логические маски
- GroupBy, агрегация и сводные таблицы
- Объединение, соединение и очистка данных