模型
MaaS 模型即服务平台扮演大脑的角色,负责核心的理解、推理与生成任务,赋予应用灵活的思考与决策能力。推荐混合模型架构:通用大模型处理复杂推理,垂直小模型处理高频专项 — Qwen-7B 量化后推理成本降 60%。
11 要素工程化能力 — 让 AI 原生架构真正可落地。云原生解决「如何高效跑起来」,AI 原生解决「如何智能跑起来」,我们把 11 个关键要素变成可交付、可运营的工程能力。
从模型到安全的 11 个关键要素,每一个都配有对应产品与工程实践,支撑 AI 原生应用从设计、交付到长期运营的全生命周期。
扮演大脑的角色,负责核心的理解、推理与生成任务,赋予应用灵活的思考与决策能力。推荐混合模型架构:通用大模型处理复杂推理,垂直小模型处理高频专项 — Qwen-7B 量化后推理成本降 60%。
封装通用能力,内置 CoT、ReAct、Plan-and-Execute、Role-playing 四种设计模式;多智能体类型体系覆盖 SequentialAgent、ParallelAgent、LoopAgent、LlmRoutingAgent — 框架形态三分:低代码、高代码、零代码。
「Garbage In, Garbage Out」— Prompt 质量直接决定 AI 生成质量。四大原则:明确角色、完整上下文、范例引导、结构化输出;从提示词工程升级为「上下文工程」— Write-Select-Compress-Isolate 四步策略。
价值从解决幻觉向赋能业务演进。三阶段:索引 → 检索 → 生成;分块优化(语义分块、滑动窗口、父子块映射)+ 混合检索(向量 + BM25 + RRF 融合)+ 重排序(Qwen-Reranker);未来方向:Agentic RAG、多模态 RAG、知识图谱融合。
实现跨越会话的连贯性、个性化与深度推理。多级记忆系统:短期管理当前会话上下文(最近 5 轮),长期存储跨会话知识(每 5 轮摘要提取);运行时上下文处理 Write-Select-Compress-Isolate 四步策略。
工具是大模型向物理世界延伸的载体。MCP(Model Context Protocol)被誉为「AI 界 USB-C」,把 N×N 适配转为「一次对接、处处可用」;应对工具过载:统一注册中心、AI 网关工具精选、All-in-One MCP Server 语义检索。
AI 网关九大核心能力:多模型代理、多模型回退容灾、消费者认证、内容安全防护、Token 限流、语义缓存(相同输入相同输出)、可观测性、MCP 代理、工具动态组装。双重角色:存量系统连接器 + AI 能力出口。
三大突破:会话级状态管理(独立存储与内存空间)、毫秒级弹性(冷启动毫秒级)、成本精细化(Active/Idle 忙闲状态)。三类运行时:模型运行时(异构算力调度)、智能体运行时(MicroVM 硬件级隔离)、工具云沙箱(防代码逃逸)。
三大独特挑战:性能(延迟峰值需精确定位根源)、成本(Token 收费需追踪每请求)、质量(幻觉偏见需检测)。全链路追踪基于 OpenTelemetry,全栈三层覆盖:应用可观测、AI 网关可观测、推理引擎可观测。
AI 应用行为本质是非确定性概率输出。引入 LLM-as-a-Judge 范式 — 用前沿大模型作为「裁判」评估其他模型输出;三种方式:逐点评估、成对比较、多维度校验,应对位置偏见、冗长偏见、能力天花板三大偏见。
三类新型风险:应用层(SSRF 攻击、拒绝钱包攻击)、模型层(提示词注入、越狱、幻觉)、数据层(投毒、泄露)。五层防护:应用安全(Token 配额、上下文隔离)、模型安全(输入检测 + 推理防越狱 + 输出抑制幻觉 + 数字水印)、数据安全(六阶段全生命周期)、身份安全(NHI 非人类身份管控)、系统网络安全(资产发现 + 微隔离)。