Pandas est LA bibliothèque pour manipuler des données tabulaires (genre Excel ou sql) en Python. L'objet central est le DataFrame.
Installation : pip install pandas Import conventionnel :
import pandas as pdUn DataFrame est un tableau 2D :
- colonnes nommées (comme une table SQL)
- lignes indexées (par défaut : 0, 1, 2, ...)
- chaque colonne peut avoir un type différent (int, str, float, bool, datetime...)Dans le dict, chaque clé est un nom de colonne, chaque valeur une liste = la colonne :
data = {
'nom': ['Alice', 'Bob', 'Charlie'],
'note': [14, 11, 17],
'ville': ['Paris', 'Lyon', 'Marseille']
}
df = pd.DataFrame(data)print(df)
# nom note ville
# 0 Alice 14 Paris
# 1 Bob 11 Lyon
# 2 Charlie 17 Marseilledf.shape # (lignes, colonnes) — ex (3, 3)
df.columns # noms des colonnes
df.dtypes # type de chaque colonne
df.head() # 5 premières lignes
df.tail(3) # 3 dernières lignes
df.info() # résumé (types, non-null, mémoire)
df.describe() # stats descriptives des colonnes numériques
df['note'] # accéder à une colonne (renvoie une Series)
df[['nom','note']] # accéder à plusieurs colonnes (renvoie un DataFrame)pd.read_csv('fichier.csv') # depuis un CSV
pd.read_excel('fichier.xlsx') # depuis un Excel
pd.read_json('fichier.json') # depuis JSON
pd.read_sql(query, connexion) # depuis une base SQLQuand tu touches à des données tabulaires (csv, base de données, Excel), pandas est presque toujours le bon choix.
Envie d'aller plus loin ? Découvrez nos formations certifiées Bac+2 à Bac+5 →