Volver a la lista

¿Qué es pandas? — Series y DataFrame

Comprenda las estructuras de datos fundamentales de pandas, Series y DataFrame, y aprenda los conceptos básicos para cargar y manipular datos.

Principiante
|
7min
|
Verificado (2026-07)
Progreso0/17 (0%)

pandas: Series y DataFrame

Al finalizar este tema

Podrás explicar qué son las Series y los DataFrame de pandas, y cargar archivos CSV para realizar operaciones básicas.


Qué es pandas

pandas es una biblioteca de Python para manipular datos tabulares. Puedes pensar en ella como una forma de manejar hojas de cálculo de Excel mediante código.

python
import pandas as pd
# Leer archivo CSV — con esta línea basta
df = pd.read_csv("students.csv")
print(df)
text
nombre  edad  puntuación
0  Kim Hoon    25    85
1  Lee Soo    23    92
2  Park Jin    27    78

pd es la abreviatura convencional de pandas. En el código de análisis de datos, casi siempre se utiliza de esta manera.


Series: datos de una sola fila

Una Series es un arreglo unidimensional con índice. Una columna de un DataFrame es una Series.

python
import pandas as pd
# Crear Series
scores = pd.Series([85, 92, 78], index=["Kim Hoon", "Lee Soo", "Park Jin"])
print(scores)
text
Kim Hoon    85
Lee Soo    92
Park Jin    78
dtype: int64
python
# Acceso por índice
print(scores["Lee Soo"]) # 92
# Filtro de condiciones
print(scores[scores >= 80])
# Lee Soo 92
# Kim Hoon 85
# Operación
print(scores.mean()) # 85.0
print(scores.max()) # 92

Es similar a una lista, pero se puede acceder por nombre y cuenta con métodos estadísticos integrados.


DataFrame — Tabla completa

Un DataFrame es una tabla bidimensional compuesta por múltiples Series. Tiene filas (rows) y columnas (columns).

python
import pandas as pd
# Crear diccionario
data = {
"Nombre": ["Kim Hoon", "Lee Soo", "Park Jin"],
"Edad": [25, 23, 27],
"Puntuación": [85, 92, 78]
}
df = pd.DataFrame(data)
print(df)
text
Nombre  Edad  Puntuación
0  Kim Hoon   25    85
1  Lee Soo   23    92
2  Park Jin   27    78

Controles básicos

python
# Selección de columna
print(df["nombre"]) # Devuelve Series
print(df[["nombre", "puntuación"]]) # Devuelve DataFrame
# Selección de fila
print(df.loc[0]) # Fila 0 (por nombre)
print(df.iloc[0]) # Fila 0 (por posición)
# Filtro por condición
high = df[df["puntuación"] >= 80]
print(high)
# nombre edad puntuación
# 0 Kim Hoon 25 85
# 1 Lee Soo 23 92
# Estadísticas básicas
print(df.describe())
# Promedio, desviación estándar, mínimo/máximo de edad y puntuación, etc.

Métodos frecuentes

python
df.head(3) # Primeras 3 filas
df.tail(3) # Últimas 3 filas
df.shape # (número de filas, número de columnas) — ej: (3, 3)
df.columns # Lista de nombres de columnas
df.dtypes # Tipo de datos de cada columna
df.info() # Información resumida (incluye valores faltantes)
df.sort_values("puntuación", ascending=False) # Ordenar puntuaciones de mayor a menor

Agregar y eliminar columnas

python
# Agregar nueva columna
df["aprobado"] = df["puntuación"] >= 80
print(df)
# nombre edad puntuación aprobado
# 0 Kim Hun 25 85 True
# 1 Lee Su 23 92 True
# 2 Park Jin 27 78 False
# Eliminar columna
df = df.drop("aprobado", axis=1)
# axis=0 es fila, axis=1 es columna

¿Por qué pandas?

TareaPython puropandas
Lectura de CSV10+ líneas (open, split, bucle)pd.read_csv() 1 línea
Calcular la mediasum()/len() cálculo directodf.mean()
Filtrado condicionalfor + ifdf[df["columna"] > valor]
Ordenaciónsorted() + keydf.sort_values()

Además de reducir la cantidad de código, pandas está optimizado internamente con C/Cython y es entre 10 y 100 veces más rápido que Python puro.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...