Day2 学习记录(2026届AI应届生补基础)

一、Excel 练手:小说章节表

自建 10 行小说数据(书名/章节/分类/字数/日期),练了 5 个操作:

  • 排序:按字数降序,确认整区域一起排
  • 筛选:分类=玄幻,确认只是隐藏不是删除
  • SUM:总字数 = 65940
  • 数据透视表:按书名汇总总字数(凡人修仙传 6900、斗破苍穹 6600 等)
  • 文本转数字:用分列/VALUE函数处理"文本数字"问题

踩坑:

  • 排序前必须选中整个数据区域,否则只对单列排序,数据错位
  • 筛选后要"全选"才能恢复,不是再点一次筛选按钮
  • 透视表"值"默认是计数,要手动改成"求和"
  • 文本数字不参与SUM计算,需用分列/VALUE/乘1转成真数字

二、Python pandas 读取 Excel

环境:Python 3.8.10 + pandas 2.3.3 + openpyxl 3.1.5

代码:python
import pandas as pd
file = r"D:\mycode\ai-data-learning\day2-excel\小说章节表.xlsx"
df = pd.read_excel(file, engine=“openpyxl”)
print(“总字数:”, df[“字数”].sum())
print(“历史分类平均字数:”, df.loc[df[“分类”]==“历史”,“字数”].mean())
print(df.groupby(“分类”)[“字数”].agg([“count”,“sum”,“mean”]))
print(df.groupby(“书名”)[“字数”].sum().sort_values(ascending=False))

运行结果:

  • 总字数:65940
  • 历史平均:3100.0
  • 按书名汇总与 Excel 透视表一致

踩坑:

  • pandas 读 xlsx 必须装 openpyxl
  • 文件路径用 r"" 前缀避免转义问题
  • Excel 里如果有多个 sheet/透视表,要指定 sheet_name 读原始数据

三、GitHub 提交

仓库:https://github.com/haohua-zheng/ai-data-learning

commit:Day2 Excel小说章节表 Pandas读取与统计

下一步

Day3 正式进入 Pandas 数据清洗(缺失值/重复值/groupby/merge)。

Logo

鲲鹏昇腾开发者社区是面向全社会开放的“联接全球计算开发者,聚合华为+生态”的社区,内容涵盖鲲鹏、昇腾资源,帮助开发者快速获取所需的知识、经验、软件、工具、算力,支撑开发者易学、好用、成功,成为核心开发者。

更多推荐