分类:科技

分享我一直在用的一套 AI 记忆系统方案

13 阅读 0 4777 字 · 约 16 分钟

我换过好几个 AI 编程助手。Kimi Code 用了一阵,换 Claude Code,后来又试了 Codex。每次换的时候有个很直观的感受——之前的协作上下文全没了。 Claude 里讨论过的方案细节,Kimi 不知道。Kimi 里记着的任务进度,Claude 接不上。Agent 换一个,记忆清零

负载均衡:不只是平均分配

20 阅读 0 2283 字 · 约 8 分钟

负载均衡不只是轮询分请求。节点能力不同要加权,实时负载不同要动态选,有状态要保亲和,缓存要一致性哈希,节点上下线要平滑过渡,健康检查要主动加被动,还得和熔断配合。多层配合比单层完美更靠谱。

Streamling 的三个架构决策

14 阅读 0 2473 字 · 约 9 分钟

三个架构决策,每个都在简洁和稳健之间选了简洁。Checkpoint 搭载在数据上、优化器规则注入流处理语义、插件共享宿主 runtime。如果是我会怎么选。

熔断与降级:故障的防火墙

23 阅读 0 1863 字 · 约 7 分钟

级联故障的根因不是下游挂了,是上游在等待中耗尽资源。熔断在失败率升高时停止调用,降级在不可用时给兜底响应。两者配套才有意义——光熔断不降级是快死,光降级不熔断挡不住资源耗尽。

Web 服务器怎么选

21 阅读 1 3737 字 · 约 13 分钟

Nginx、Apache、Tomcat、Caddy、Traefik,还有框架自带的 uvicorn、Gunicorn、net/http——这些 Web 服务器各自擅长什么,什么场景选什么。

脑裂:分布式系统里最危险的故障

53 阅读 0 2743 字 · 约 10 分钟

脑裂:集群分区后两个子集各自选出主节点,并行写入导致数据分叉。根因不是节点真挂了,而是看起来挂了——网络分区、心跳超时、VM暂停都会触发。防护靠 quorum + fencing token + 租约三层。Raft/Paxos 防选主脑裂,但 fencing 仍需存储层配合。

重试与退避:失败之后怎么办

45 阅读 0 3049 字 · 约 11 分钟

朴素重试(失败立刻重试)在大规模下会引发重试风暴和级联放大。正确策略四件套:指数退避(给下游恢复时间)+抖动(打破同步)+重试预算(限制总重试流量)+只重试瞬时故障且幂等的操作。再配熔断器兜底——重试失败到阈值就停止,别一直试一个挂掉的服务。重试不是"再试一次",是需要设计的工程。