你好,我是 h333。

一名专注于数据工程的技术践行者。我深耕于数据的采、存、管、算全链路,致力于构建稳定、高效且具有扩展性的数据基础设施。

我相信"好的数据架构应该是优雅且简练的"。在构建大数据 pipeline 时,无论是批处理还是实时流计算,保持逻辑清晰、性能卓越以及代码的纯净,是我的核心追求。在这里,我会记录关于数据仓库、流式计算、以及架构设计的深度思考。

核心业务领域

实时流计算

基于 Flink 构建毫秒级/秒级的实时数据清洗、ETL 与监控告警系统。

📊

离线数仓与批处理

基于 Spark 编写大规模离线数仓任务,支持海量数据的报表分析与 T+1 调度。

🏗️

数据湖与一体化架构

处理围绕 Data Lake 的各类异构数据源接入(关系型、日志、埋点等),统一规范并进行数据治理。

技能图谱

编程与核心语言

Java Python SQL

大数据计算引擎

Apache Spark Apache Flink

数据存储与中间件

MySQL PostgreSQL MongoDB Redis ClickHouse Hive Kafka

基础设施与运维

Linux Docker Kubernetes Git Nginx