从模型管理到 AI 网关:权限、流量与成本如何形成闭环
模型管理产生权限、配额和路由规则,AI 网关在每一次请求中执行这些规则,再将真实用量与运行状态送回业务侧。本文通过模型消费与治理、请求执行两条主线,说明两套系统如何协同。
模型管理产生权限、配额和路由规则,AI 网关在每一次请求中执行这些规则,再将真实用量与运行状态送回业务侧。本文通过模型消费与治理、请求执行两条主线,说明两套系统如何协同。
生产 API7 AI 网关一次升级引出两个互相独立的缺陷:流式请求偶发 500、低流量下多 worker CPU 打满,最明显的节点还叠加调频策略差异。开头先给结论摘要,再回溯排查过程:对照实验、监控反例、依赖 diff、perf 与受控复现,以及临时止血、最终修复与节点调频差异。
读百炼网关用 RocketMQ LiteTopic 重构大模型限流的文章后,记录核心思路,并补上原文跳过的响应通道设计——消费端调模型后,流式响应怎么回到客户端。
线上 API7 网关偶发 504 且耗时精确卡在 15 秒,经代码追踪、内核参数分析与抓包验证,定位为 tcp_syn_retries=3 导致的 SYN 重传超时。
比较 OpenCode、Pi、DeepSeek Harness、Codex、Claude Agent SDK 和 OpenHands,区分独立运行、HTTP API 和会话管理,给出决策路径与建设量估算,并讨论接入业务时的职责边界和数据合规。
在阅读六本大模型书籍的过程中,从技术演进、分词、注意力、MoE、GPU、Prefill、Decode、RAG、微调和评估等角度,阶段性梳理大模型从 Token 到答案的完整链路。
通过一个可运行的点餐 Demo,串联 Tool Calling、MCP、A2A、AG-UI、HITL、Skill 路由与多 Agent 协作的完整开发链路。
结合阅读与工程实践思考AI深度参与工作和生活后,普通人如何守住独立判断、责任意识、基本功和长期能力,避免把决策完全交给模型。
《Harness工程》读书笔记,梳理上下文管理、规划执行、反思记忆、Skills、多 Agent 协作与 Agent 产品设计。
沿一份文档和一次提问的完整链路,拆解 Go 项目中的异步解析、OCR、切片、混合检索、RRF、Reranker、引用校验与故障降级。