データ分析や機械学習で頻繁に使用されるPythonのライブラリ「pandas」は、データの操作や加工が非常に簡単に行えます。本記事では、pandasでデータをフィルタリングする方法を初心者にもわかりやすく解説します。データの抽出や条件による選択方法をマスターし、効率的なデータ分析を目指しましょう。
1. フィルタリングの基本
pandasでデータをフィルタリングする基本は、ブールインデックスを使用することです。条件式を指定して、TrueまたはFalseの配列を作成し、それを元にデータを抽出します。
例:
import pandas as pd
# サンプルデータの作成
data = {'名前': ['太郎', '花子', '次郎', '三郎'],
'年齢': [25, 30, 22, 28],
'得点': [85, 90, 78, 88]}
df = pd.DataFrame(data)
# 年齢が25以上のデータを抽出
df_filtered = df[df['年齢'] >= 25]
print(df_filtered)
出力:
名前 年齢 得点
0 太郎 25 85
1 花子 30 90
3 三郎 28 88
解説:
df['年齢'] >= 25は、各行の年齢が25以上かどうかを判定し、ブール値のSeriesを返します。df[ブール値のSeries]で、Trueの行だけを抽出します。
2. 条件によるデータの抽出
単一条件でのフィルタリング
例:得点が80以上のデータを抽出
df_filtered = df[df['得点'] >= 80]
print(df_filtered)
出力:
名前 年齢 得点
0 太郎 25 85
1 花子 30 90
3 三郎 28 88
特定の値を持つデータを抽出
例:名前が「次郎」のデータを抽出
df_filtered = df[df['名前'] == '次郎']
print(df_filtered)
出力:
名前 年齢 得点
2 次郎 22 78




