技能标签
专业技能
精通Hive与Spark大数据离线分析框架,具备复杂ETL流程设计能力。熟悉Java/Scala开发语言,遵循阿里Java开发规范。掌握Kafka消息队列、ElasticSearch全文检索、MySQL/Redis/ClickHouse等多类型数据库系统。具备HBase、Presto、Azkaban、Sqoop、Flume、DataX等大数据组件的实战经验,熟悉分布式架构设计与数据治理方案
工作履历(脱敏处理)
主导数仓分析平台建设,搭建DataX+Hadoop+Hive离线架构与Nginx+Kafka+Spark实时计算体系,实现日均PB级用户行为数据采集与多维分析。设计Canel多Topic单分区路由方案解决Kafka消息顺序问题,开发IP地址解析UDF提升数据准确性。通过Presto UDAF替代多表JOIN操作,使用户深度分析模型计算效率提升30%。搭建监控体系实现数据质量实时校验,支撑产品决策优化,提升用户转化率15%
项目经验(脱敏处理)
项目一:数仓分析平台
技术架构:DataX + Hadoop + Hive + Azkaban(离线);Nginx + Zookeeper + Kafka + MySQL + Canal + HDFS + Hive + Spark + Hudi + Presto(实时);nginx-lua-prometheus + Burrow + Prometheus + Grafana(监控)
职责:1. 设计日志采集方案,通过Canal同步MySQL BinLog至Kafka,采用多Topic单分区路由保障表级顺序性;2. 开发Spark Streaming实时计算链路,实现Hudi增量数据同步与Hive数据仓库更新;3. 构建数据指标体系,开发IP地址解析UDF及用户深度分析模型,支撑业务决策;4. 优化多表JOIN性能,通过Presto UDAF实现漏斗深度计算,降低计算资源消耗
难点突破:1. 解决Canal BinLog消息顺序性问题,采用多Topic单分区路由策略;2. 动态Schema解析机制确保数据准确性,通过Meta中心管理字段映射关系;3. 通过UDAF替代多表JOIN,使用户深度分析模型计算效率提升30%。项目二:GC电商数据平台
技术架构:Master爬虫+Redis(Url池)+Kafka(脏数据处理)
职责:设计分布式爬虫架构,构建Redis Url池管理采集任务,通过Kafka实现脏数据隔离与异步处理,建立数据质量监控体系,保障数据采集完整性与时效性
驻场外包优势
服从性高
严格遵守甲方管理制度
技术扎实
1年项目实战经验
可长期驻场
接受异地项目外派
快速响应
24小时内可到岗
企业人才对接
专业IT人力外包服务
如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。
合作热线
18969108718
商务邮箱
ntit@163.com
微信扫码咨询
扫描二维码添加商务对接