关于我
数据开发工程师 / 大数据架构爱好者
你好,我是 h333。
一名专注于数据工程的技术践行者。我深耕于数据的采、存、管、算全链路,致力于构建稳定、高效且具有扩展性的数据基础设施。
我相信"好的数据架构应该是优雅且简练的"。在构建大数据 pipeline 时,无论是批处理还是实时流计算,保持逻辑清晰、性能卓越以及代码的纯净,是我的核心追求。在这里,我会记录关于数据仓库、流式计算、以及架构设计的深度思考。
核心业务领域
实时流计算
基于 Flink 构建毫秒级/秒级的实时数据清洗、ETL 与监控告警系统。
离线数仓与批处理
基于 Spark 编写大规模离线数仓任务,支持海量数据的报表分析与 T+1 调度。
数据湖与一体化架构
处理围绕 Data Lake 的各类异构数据源接入(关系型、日志、埋点等),统一规范并进行数据治理。