流式500、多个worker跑满,还有一行powersave:一次API7 AI网关的排查记录
生产 AI 网关升级后出现流式请求偶发 500、单节点多个 worker 接近满载但流量不高。通过对照实验、监控相位分析、依赖 diff 与 perf 热点交叉验证,最终定位到 SSE 刷新误判断连和 Prometheus key-index 回归,并发现 56 节点存在 powersave 调频差异。
生产 AI 网关升级后出现流式请求偶发 500、单节点多个 worker 接近满载但流量不高。通过对照实验、监控相位分析、依赖 diff 与 perf 热点交叉验证,最终定位到 SSE 刷新误判断连和 Prometheus key-index 回归,并发现 56 节点存在 powersave 调频差异。
读百炼网关用 RocketMQ LiteTopic 重构大模型限流的文章后,记录核心思路,并补上原文跳过的响应通道设计——消费端调模型后,流式响应怎么回到客户端。
线上AI网关偶尔报504,请求耗时全部精确卡在15秒。通过代码追踪、内核参数分析、DNS排除和抓包验证,最终定位到根因是 tcp_syn_retries=3 导致的SYN重传超时。
比较 OpenCode、Pi、DeepSeek Harness、Codex、Claude Agent SDK 和 OpenHands,并讨论独立运行、HTTP API、会话管理以及接入业务时的职责边界。
在阅读六本大模型书籍的过程中,从技术演进、分词、注意力、MoE、GPU、Prefill、Decode、RAG、微调和评估等角度,阶段性梳理大模型从 Token 到答案的完整链路。
通过一个可运行的点餐 Demo,串联 Tool Calling、MCP、A2A、AG-UI、HITL、Skill 路由与多 Agent 协作的完整开发链路。
结合阅读与工程实践思考AI深度参与工作和生活后,普通人如何守住独立判断、责任意识、基本功和长期能力,避免把决策完全交给模型。
《Harness工程》读书笔记,梳理上下文管理、规划执行、反思记忆、Skills、多 Agent 协作与 Agent 产品设计。
沿一份文档和一次提问的完整链路,拆解 Go 项目中的异步解析、OCR、切片、混合检索、RRF、Reranker、引用校验与故障降级。
从网关基本功、AI 流量理解、运行时性能和工程治理四个维度,建立可量化的 AI Gateway 选型评分框架。