简介这份Python人口普查数据可视化项目源码面向高校学生、数据分析初学者及需要完成期末大作业或课程设计的开发者围绕1953至2021年七次全国人口普查数据解决各省人口数量变化趋势的统计分析与图表呈现问题。压缩包共10个文件约9.24MB包含py主程序脚本、xlsx原始数据表、html交互图表、gif动态演示、mp4讲解视频及png配图等覆盖从数据读取、清洗到可视化输出的完整流程。目前已有467人学习下载项目曾获导师指导并通过97分期末考核代码完整可直接运行。读者可参考其数据处理逻辑与可视化实现方式快速理解人口普查数据的分析思路并借助动态图表与录屏演示完成自己的课程设计或大作业适合作为数据分析入门与实战参考。1. 从一份 97 分课设拆起七次人口普查数据到底能玩出什么花样期末大作业选题里人口普查数据分析是那种看起来平平无奇、做起来处处是坑的典型。我拿到这份python人口普查以及各省人口数量变化情况可视化项目源码的时候第一反应是1953 到 2021 年、七次全国人口普查、三十多个省级行政区这套数据的时间跨度和维度足够撑起一个完整的可视化项目。它解决的核心问题很具体——把散落在七次普查公报里的省级人口数字整理成一张能直接喂给 Python 的宽表再输出成 HTML 交互页、GIF 动图和 MP4 视频三种形态。适合谁正在找 python 数据分析与可视化课程设计案例的在校生以及想拿真实统计数据练手 pandas pyecharts 的入门者。这份源码包里的七次人口普查数据.xlsx是整条链路的起点0511.py是唯一的执行入口剩下的 html、gif、mp4、png 全是它的产物。2. 数据底座怎么搭七次普查的省级面板数据整理2.1 为什么这份数据值得单独讲人口普查数据跟普通的年度统计年鉴不一样。七次普查的年份分别是 1953、1964、1982、1990、2000、2010、2020第七次实际执行在 2020 年公报 2021 年发布间隔不规律早期几次的省级口径还经历过行政区划调整——比如海南 1988 年才建省、重庆 1997 年才直辖。这意味着你不能简单地把七列数字并排一放就完事得先想清楚哪些省份在哪些年份是不存在的缺失值该补零还是留空。我一般会先把七次人口普查数据.xlsx读进来看看结构。常见做法是用 pandas 直接读然后打印列名和前几行确认字段import pandas as pd # 读取七次人口普查数据sheet_name 按实际文件调整 df pd.read_excel(七次人口普查数据.xlsx, sheet_name0) # 看列名、数据类型、前五行确认年份列和省份列的命名 print(df.columns.tolist()) print(df.dtypes) print(df.head()) # 统计每个省份在七次普查中是否有缺失 print(df.isnull().sum())这段代码的逻辑很直白先摸清字段名再判断缺失分布。参数上要注意sheet_name如果 Excel 里有多个 sheet比如按年份分表得逐个读或者用sheet_nameNone一次性读成字典。df.isnull().sum()是排查数据完整性的第一步如果某个省份缺失次数超过两次基本可以判断是行政区划变动导致的不是数据录入错误。2.2 把宽表转成可视化友好的长表pyecharts 和 matplotlib 对数据形状的要求不同。做省份对比柱状图宽表一行一个省、一列一个年份更顺手做时间轴轮播或者 GIF 动图长表每行是省份-年份-人口三元组更方便按年份切片。我通常两个都留一份# 宽表省份为索引年份为列 df_wide df.set_index(省份) # 长表用 melt 把年份列压成两列 df_long df_wide.reset_index().melt( id_vars省份, var_name年份, value_name人口 ) # 年份列如果是字符串转成整数方便排序 df_long[年份] df_long[年份].astype(int) df_long df_long.sort_values([年份, 省份]) print(df_long.head(10))melt是 pandas 里做宽长转换的核心函数id_vars指定保持不变的列var_name和value_name分别给新生成的变量列和值列命名。这里有个容易翻车的点如果年份列名是1953年这种带中文的字符串astype(int)会直接报错得先用str.replace(年, )清洗。我见过不少同学在这一步卡住以为是 pyecharts 的问题其实是数据没洗干净。提示melt之后如果人口列出现 NaN先别急着fillna(0)。海南 1953 年确实没有独立人口数据填 0 会在折线图上造成从零暴涨的假象更合理的做法是留空让图表断线或者在注释里说明。2.3 省级名称标准化这件小事pyecharts 的地图组件对省份名称极其敏感。内蒙古自治区和内蒙古在它眼里是两个东西写错了地图上那块就是灰的。我一般会在数据整理阶段就统一成简称# 省份名称标准化映射按实际数据里的写法补充 name_map { 内蒙古自治区: 内蒙古, 广西壮族自治区: 广西, 西藏自治区: 西藏, 宁夏回族自治区: 宁夏, 新疆维吾尔自治区: 新疆, 北京市: 北京, 上海市: 上海, 天津市: 天津, 重庆市: 重庆 } df_long[省份] df_long[省份].replace(name_map) # 检查是否有未映射到的名称 print(df_long[省份].unique())replace传字典是 pandas 里做批量替换的标准写法比写循环干净得多。替换完一定要用unique()把全部省份名打出来肉眼过一遍确认没有漏网的省市自治区后缀。这一步花两分钟能省掉后面调地图时半小时的排查。3. 可视化三件套HTML 交互页、GIF 动图、MP4 视频怎么生成3.1 pyecharts 出 HTML时间轴轮播柱状图源码包里有两个 HTML 文件分别是1953~2021年不同省份总人口.html和第七次人口普查不同省份总人口.html。前者是带时间轴的轮播图后者是单年份的静态对比。时间轴轮播的核心是Timeline组件from pyecharts import options as opts from pyecharts.charts import Bar, Timeline # 按年份分组每年一个 Bar timeline Timeline() timeline.add_schedule(opts.TooltipOpts(is_showTrue)) for year in sorted(df_long[年份].unique()): year_data df_long[df_long[年份] year].sort_values(人口, ascendingFalse) bar ( Bar() .add_xaxis(year_data[省份].tolist()) .add_yaxis(f{year}年, year_data[人口].tolist()) .set_global_opts( title_optsopts.TitleOpts(titlef{year}年各省人口), xaxis_optsopts.AxisOpts(axislabel_optsopts.LabelOpts(rotate45)), yaxis_optsopts.AxisOpts(name人口万人) ) ) timeline.add(bar, f{year}年) timeline.render(1953~2021年不同省份总人口.html)Timeline.add()的第二个参数是时间轴上的标签用年份字符串最直观。rotate45是为了防止省份名太长挤在一起这个参数在省份数量超过 20 个时基本是必加的。render()输出的 HTML 是自包含的双击就能在浏览器里打开不需要起服务器。如果你要交作业这个文件直接截图或者录屏都行。3.2 GIF 动图用 imageio 把逐年图表串起来源码包里有三个 GIF1953~2021年不同省份总人口.gif、第七次人口普查不同省份总人口.gif、1953_2021年七次人口普查以及各省人口数量变化情况.gif。GIF 的本质是把多帧图片按顺序拼起来常见做法是用 matplotlib 逐帧渲染成 PNG再用 imageio 合成import matplotlib.pyplot as plt import imageio import os # 中文字体设置Windows 下用 SimHeiMac 下用 Arial Unicode MS plt.rcParams[font.sans-serif] [SimHei] plt.rcParams[axes.unicode_minus] False frames [] years sorted(df_long[年份].unique()) for year in years: year_data df_long[df_long[年份] year].sort_values(人口, ascendingFalse) fig, ax plt.subplots(figsize(12, 6)) ax.barh(year_data[省份], year_data[人口]) ax.set_title(f{year}年各省人口) ax.set_xlabel(人口万人) plt.tight_layout() # 存成临时 PNG fname fframe_{year}.png plt.savefig(fname, dpi100) plt.close() frames.append(imageio.imread(fname)) os.remove(fname) # 合成 GIFduration 控制每帧停留时间秒 imageio.mimsave(人口变化.gif, frames, duration0.8, loop0)duration0.8表示每帧停 0.8 秒七帧下来大概五六秒节奏刚好。loop0是无限循环。这里最大的坑是中文字体matplotlib 默认字体不含中文不设font.sans-serif的话所有汉字都会变成方框。Windows 用SimHeiMac 用Arial Unicode MSLinux 服务器上如果没有中文字体得先apt install fonts-wqy-zenhei再指定WenQuanYi Zen Hei。3.3 MP4 视频ffmpeg 合成与帧率控制1953_2021年七次人口普查以及各省人口数量变化情况.mp4这个文件我推测是用 ffmpeg 把上面那批 PNG 帧合成的。如果你机器上装了 ffmpeg一条命令就能搞定# 把 frame_*.png 按文件名顺序合成 MP425 帧每秒 ffmpeg -framerate 1 -pattern_type glob -i frame_*.png \ -c:v libx264 -pix_fmt yuv420p -r 25 \ 人口变化.mp4-framerate 1表示输入图片按每秒 1 张读取-r 25是输出视频帧率。这样每张图会在视频里停留 1 秒但视频本身是 25fps 的流畅格式。-pix_fmt yuv420p是为了兼容大多数播放器不加这个参数在某些设备上会黑屏。如果你不想装 ffmpeg也可以用moviepy纯 Python 实现但合成速度会慢不少。注意GIF 和 MP4 的帧顺序依赖文件名排序frame_1953.png到frame_2020.png按字符串排序是没问题的但如果年份写成frame_1953.png、frame_1964.png……到frame_2000.png也正常。真正会翻车的是frame_1.png到frame_10.png这种字符串排序会把 10 排在 2 前面得用零填充命名。4. 避坑与排查这份源码跑不起来时先看这几条4.1 现象pyecharts 地图一片灰省份颜色出不来原因基本锁定在省份名称不匹配。pyecharts 的 Map 组件内置了一份省份名称列表你传内蒙古自治区它认传内蒙它就不认。解决方式是回到 2.3 节的name_map把所有名称统一成 pyecharts 认可的简称。排查技巧先print(df[省份].unique())再对照 pyecharts 官方示例里的省份写法逐个核对。4.2 现象matplotlib 图表里中文全是方框这是字体问题不是编码问题。plt.rcParams[font.sans-serif]设了但没生效通常是因为设的字体系统里没有。解决方式Windows 确认C:\Windows\Fonts\simhei.ttf存在Mac 用Arial Unicode MSLinux 先装fonts-wqy-zenhei再设WenQuanYi Zen Hei。设完记得加plt.rcParams[axes.unicode_minus] False否则负号也会变方框。4.3 现象pd.read_excel报ImportError: Missing optional dependency openpyxlpandas 读 xlsx 依赖 openpyxl但 pandas 不会自动装。解决方式就一行pip install openpyxl。如果读的是老版.xls文件还得装xlrd而且 xlrd 新版本只支持 xls 不支持 xlsx别装混了。4.4 现象GIF 合成后文件巨大几十兆传不上去imageio.mimsave默认不压缩七帧 1200x600 的图轻松上 20MB。解决方式有两个一是渲染 PNG 时把dpi降到 80 左右二是用pillow的save方法加optimizeTrue和duration参数重新压一遍。如果只是交作业把figsize从(12, 6)降到(10, 5)也能省不少体积。4.5 现象时间轴轮播图在浏览器里年份顺序乱了Timeline默认按add()的调用顺序排列如果你是从 DataFrame 里直接迭代年份而 DataFrame 没排序顺序就是乱的。解决方式迭代前先sorted(df_long[年份].unique())确保按年份升序添加。这个坑很隐蔽因为图表能出来只是时间轴顺序不对不仔细看容易忽略。5. 从能跑到能讲把这份课设变成你自己的东西5.1 换一组数据验证代码通用性这份源码的价值不只在人口数据本身更在于它是一条完整的Excel → pandas 清洗 → pyecharts/matplotlib 可视化 → GIF/MP4 导出链路。想验证自己是不是真懂了最直接的办法是换一组数据跑一遍。比如把七次人口普查数据.xlsx换成各省 GDP 或者粮食产量只要列结构一致0511.py里的清洗和绘图逻辑基本不用大改。我一般会保留df_long这个中间产物因为它同时兼容地图、柱状图、折线图三种图表类型换数据时只需要改value_name对应的字段。5.2 给图表加一层结论注释课设评分里光有图不够老师看的是你有没有从图里读出东西。比如第七次普查里广东和山东稳居前二但 1953 年四川才是人口第一大省——这种排名变化才是分析的价值点。我习惯在 HTML 图表旁边加一段文字说明或者在 MP4 的最后一帧停留久一点把关键结论打上去。具体做法是在Timeline最后add()一个纯文本的Bar或者用opts.TitleOpts的subtitle参数挂结论。5.3 参数速查表参数作用常用值备注figsizematplotlib 画布尺寸(12, 6)太大导致 GIF 体积暴涨dpi渲染分辨率80~100超过 150 文件明显变大durationGIF 每帧停留秒数0.5~1.0太短看不清太长文件大rotatex 轴标签旋转角度45省份多时必加-rffmpeg 输出帧率25低于 15 会卡顿-pix_fmt视频像素格式yuv420p不加可能黑屏5.4 我踩过的那次坑第一次跑这份源码的时候GIF 合成出来是倒序的2020 年在最前面1953 年在最后。排查了半天以为是imageio的问题最后发现是os.listdir()返回的文件名顺序跟我想的不一样。从那以后我每次合成 GIF 或者视频都强制先把帧文件按年份排序再读绝不依赖文件系统的默认顺序。这个习惯后来在做好几个可视化项目时都救过我——文件系统不保证顺序这件事真的是个黑匣子。希望这份拆解能帮你把这份 python 人口普查可视化课设真正跑通、讲透而不只是交个压缩包了事。本文还有配套的精品资源点击获取