标签

装备 Spark 大数据 面试 羽毛球 技巧 投资 Agent AI 失业 创业 Java 效率 游泳 反思 职场 时间管理 VibeCoding 生活 rust 量化 股票 回测 人性 认知 徒步 礼仪 健身 社会 科技 求职 教学 露营 运动 方法论 安全 健康 Linux 进程通信 并发 心态 精力管理 防骗 写作 思考 Hudi 数据湖 Iceberg Delta Lake Paimon 技术选型 Flink 实时数据 实战 Parquet Avro COW MOR 存储 File Group Index Bloom Filter 索引 Timeline 元数据 事务 并发控制 乐观锁 LockProvider 入门 概述 个人博客 杂思 学习路径 LLM RAG 分组 策略 FFI Python 编译原理 系统编程 跨语言调用 libffi C ABI PyO3 JNI Panama 内存管理 C GC 数据中台 工程思维 三十六计 量化投资 缓存 架构设计 架构 业务驱动 技术价值 信任 端到端对账 简单优先 MVP 复杂度 过度设计 案例 跑得稳 容错 可观测 灰度 成本意识 稳定性 跑得快 性能优化 二八法则 profiling 基础设施 数据 产品 技术史 模块化 数据拉取 科普 风险 收益 subagent 微服务 架构思维 校验 CRC 计算机科学 加密 AES RSA 密码学 定时任务 cron Airflow Kubernetes XXL-JOB 选型 后端 日志 DEBUG INFO WARN ERROR 分布式系统 分布式理论 复制 分区 路由 逻辑时钟 向量时钟 时间 一致性 CAP 共识 Paxos Raft ZAB 分布式事务 2PC Saga TCC 分布式锁 领导者选举 仓位管理 分布式 文件系统 TOCTOU 限流 重试 压缩算法 认证 鉴权 JWT OAuth RBAC 选择指南 技术债 波动率 标准差 思维 策略容量 冲击成本 消息队列 异步 因果 流处理 Arrow 开源项目 负载均衡 过拟合 幂等性 服务发现

全部文章

【Hudi】 并发控制 — 多个作业同时写怎么办

65 阅读 0 1928 字 · 约 7 分钟

两个写入作业同时往一张表写数据,会不会把对方的数据覆盖掉? 数据模型 先讲 Hudi 的数据模型,因为并发控制的前提是知道每条记录长什么样。 不是所有 Hudi 表都要有主键和分区。 COW 表可以不指定 recordKey,只能做批量追加,每次写入都是新文件。MOR 表必须指定 recordKey

【Hudi】 Timeline — Hudi 的事务日志

75 阅读 0 2709 字 · 约 10 分钟

Hudi 表目录下有个 .hoodie/ 文件夹,里面放的不是数据,是元数据。这套元数据叫 Timeline,是 Hudi 读写一致性的核心。 为什么需要 Timeline Parquet 文件本身是死的——它不会告诉你"我现在是最新版本"还是"已经被更新替代了",也不会告诉你"写我的那个作业成功提

【Hudi】 更新怎么定位 — File Group + Index

62 阅读 0 1290 字 · 约 5 分钟

一条更新来了,Hudi 怎么知道要改哪个文件?这就是 File Group 和 Index 要解决的事。 为什么不能扫全表 最简单的更新方案是:找出所有分区里所有 Parquet 文件,逐个读出来,找到要改的行,写回去。这就是全量重写的逻辑。 - 一张 100GB 的表,改一行也要扫 100GB -

【Hudi】 数据怎么存 — Parquet + Avro + 两种表类型

62 阅读 0 1143 字 · 约 4 分钟

Hudi 没有发明新存储格式,它站在 Parquet 和 Avro 之上。这不是"技术选型",而是刻意为之。 为什么用两种格式 Parquet 是列式文件,读的时候只扫需要的列,跳过滤掉的不读。一张 100 列的表查 3 个字段,Parquet 只读 3% 的数据。 Avro 是行式文件,一行一行写

【Hudi】 Hudi 是什么,解决什么问题

72 阅读 0 707 字 · 约 3 分钟

Parquet、HDFS / 对象存储上的文件,写完就不能改。但业务总是要改 — 用户改了收货地址、订单从"待支付"变成"已发货"、某笔交易被风控标黑。 这些"改一行"的事情落到 Parquet 层,就变成了"重写整个文件"。 传统做法:Hive/Spark OVERWRITE 最直接的思路是 IN

量化回测中分组条件的选择

93 阅读 0 589 字 · 约 2 分钟

在进行量化回测时,如果对所有股票使用同一套因子组合,不仅意义不大,还会影响策略在单个股票上的表现,毕竟不同的股票有着不同的特点,不应当强行硬套所谓“四海皆准”的策略参数。因此,对股票进行粗筛分组很有必要,但前提是筛选和分组条件应当与后续策略的选择存在因果关系,否则很容易出现样本量太小而没有统计学意义

Agent 学习路径(入门到进阶)

59 阅读 0 1053 字 · 约 4 分钟

学习背景 基础:Python + Rust 高级后端、大数据开发 - 基础:Python + Rust 高级后端、大数据开发 环境:国内开发环境 - 环境:国内开发环境 目标:构建复杂 Agent,覆盖面试常见问题 - 目标:构建复杂 Agent,覆盖面试常见问题 时间:每天 1 小时 - 时间:每

Agent的本质

58 阅读 0 702 字 · 约 3 分钟

核心问题:Agent 和 ChatBot 的本质区别是什么? 场景引入:用户说"帮我查一下上周的销售数据,做个分析报告" ChatBot:只能回答"我无法访问你的数据" - ChatBot:只能回答"我无法访问你的数据" Agent:能理解→规划→执行→输出报告 - Agent:能理解→规划→执行→

社会位置跃迁与自我定位

113 阅读 0 1933 字 · 约 7 分钟

从执行者到规则制定者,一个人在社会上的位置跃迁靠的不只是能力,还有资源、位置和时机。这是一篇四层位置模型下的自我定位思考。