从零开始Day2:Excel排序筛选透视表+Python用Pandas读Excel
·
Day2 学习记录(2026届AI应届生补基础)
一、Excel 练手:小说章节表
自建 10 行小说数据(书名/章节/分类/字数/日期),练了 5 个操作:
- 排序:按字数降序,确认整区域一起排
- 筛选:分类=玄幻,确认只是隐藏不是删除
- SUM:总字数 = 65940
- 数据透视表:按书名汇总总字数(凡人修仙传 6900、斗破苍穹 6600 等)
- 文本转数字:用分列/VALUE函数处理"文本数字"问题
踩坑:
- 排序前必须选中整个数据区域,否则只对单列排序,数据错位
- 筛选后要"全选"才能恢复,不是再点一次筛选按钮
- 透视表"值"默认是计数,要手动改成"求和"
- 文本数字不参与SUM计算,需用分列/VALUE/乘1转成真数字
二、Python pandas 读取 Excel
环境:Python 3.8.10 + pandas 2.3.3 + openpyxl 3.1.5
代码:python
import pandas as pd
file = r"D:\mycode\ai-data-learning\day2-excel\小说章节表.xlsx"
df = pd.read_excel(file, engine=“openpyxl”)
print(“总字数:”, df[“字数”].sum())
print(“历史分类平均字数:”, df.loc[df[“分类”]==“历史”,“字数”].mean())
print(df.groupby(“分类”)[“字数”].agg([“count”,“sum”,“mean”]))
print(df.groupby(“书名”)[“字数”].sum().sort_values(ascending=False))
运行结果:
- 总字数:65940
- 历史平均:3100.0
- 按书名汇总与 Excel 透视表一致
踩坑:
- pandas 读 xlsx 必须装 openpyxl
- 文件路径用 r"" 前缀避免转义问题
- Excel 里如果有多个 sheet/透视表,要指定 sheet_name 读原始数据
三、GitHub 提交
仓库:https://github.com/haohua-zheng/ai-data-learning
commit:Day2 Excel小说章节表 Pandas读取与统计
下一步
Day3 正式进入 Pandas 数据清洗(缺失值/重复值/groupby/merge)。
鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。
更多推荐

所有评论(0)