
简介
计算机科学专业应届毕业生,对大数据处理与分析充满热情。在校期间系统学习了Hadoop、Spark等大数据技术栈,并独立完成多个数据分析与挖掘项目。具备扎实的Java与Python编程基础,熟悉SQL及数据仓库建模。渴望在真实业务场景中应用所学知识,快速成长为一名专业的大数据工程师。
教育经历
华东理工大学
GPA 3.6/4.0
2020年9月至2024年6月
计算机科学与技术学士
华东理工大学计算机科学与技术学士。主修课程包括数据结构、数据库系统、操作系统、计算机网络、分布式系统等。连续三年获得校级奖学金,获评“优秀毕业生”。担任学院大数据社团技术部部长,组织多次技术分享活动。
项目经历
电商用户行为分析平台
项目负责人
2023年3月至2023年6月
- 设计并实现了一个基于Spark的离线分析系统,处理模拟电商平台约500万条用户点击、购买行为数据,计算用户转化率、商品热度等关键指标。
- 使用Spark SQL进行数据清洗与聚合分析,并将结果存储到MySQL中,通过ECharts实现可视化看板展示。
- 优化Spark任务的数据倾斜问题,通过增加随机前缀和调整分区数,将作业执行时间缩短约25%。
Spark, Scala, HDFS, MySQL, ECharts
实时交通流量监控系统
核心开发成员
2022年9月至2022年12月
- 基于Kafka和Flink搭建了一个模拟实时数据管道,模拟城市道路卡口每分钟产生的车辆通行数据,进行实时流量统计与拥堵预警。
- 使用Flink的窗口计算和状态管理功能,实现各路口车流量的实时统计,并将结果输出至Redis供前端展示。
- 设计并实现了数据模拟器,使用Java生成约每秒500条模拟数据,验证系统的吞吐量和低延迟处理能力。
Kafka, Flink, Java, Redis, 数据管道
基于Hadoop的日志分析系统
独立开发者
2022年3月至2022年6月
- 独立搭建了一个3节点的Hadoop集群,处理约20GB的Web服务器访问日志。
- 使用MapReduce编写日志解析与统计任务,计算PV、UV、独立IP数等指标,并将结果导入HBase提供快速查询。
- 编写了详细的集群部署文档和MapReduce开发指南,并分享至技术社区,获得超过200次收藏。
Hadoop, MapReduce, HBase, Linux
工作经历
星云数据科技有限公司
大数据实习生
2023年7月至2023年9月
杭州
- 参与公司内部大数据平台的数据清洗工作,使用Python和Pandas对日均约10万条用户行为日志进行预处理,清洗异常数据并统一格式,数据质量提升约20%。
- 协助大数据工程师使用Hive进行离线统计分析,编写HiveQL查询语句,完成用户活跃度、留存率等核心指标的计算,为运营团队提供数据支持。
- 使用Sqoop将MySQL业务数据库中的增量数据导入Hive数据仓库,每日同步约5GB数据,保障数据时效性。
- 编写Shell脚本自动化日常数据处理任务,减少人工操作时间约30%。
技能
编程语言
熟悉
Java, Python, SQL, Scala, Shell
大数据框架
基础
Hadoop, Spark, Hive, Kafka, Flink
数据存储与查询
熟悉
MySQL, HBase, MongoDB, Redis
数据处理与分析
基础
Pandas, NumPy, MapReduce, ETL, 数据可视化
其他工具
熟悉
Linux, Git, Docker, Maven, Jupyter Notebook