AI Agent 基础设施架构师 · 生产级 3D 全息技术门户
4-Node 3D Cluster: Active|Three.js WebGL: 60 FPS|Google A2A v1.0 Ready

解耦驱动的 AI Agent 运行底座
与 3D 认知记忆中枢

恪守物理彻底独立、API 契约驱动与零业务入侵。自研两阶段原子 Turn 压实、4-Tier 智能模型路由与 RRF + GraphRAG 时空记忆中枢,攻克生产级 LLM 长程工程顽疾。

载入 3D 赛博空间中枢中...
60%+

Token 综合成本削减

Smart Model Router 4-Tier 动态分流

0 截断

400 Bad Request 错误率

原子 Turn 完整性 + Compaction Seam

100%

物理与业务彻底解耦

NestJS 底座与业务独立数据库物理隔离

2~3 Hop

GraphRAG 实体多跳推导

pgvector + 全文 RRF + 剧情时空衰减

Universal 3D Cyber Holographic Hub

3D 全息交互演练中心

通过宏观架构沙盘、中观微服务拓扑与微观核心攻坚机制,电影级 3D 空间动态还原工业级 Agent 底座设计与硬核突破

载入 5 层全息架构沙盘 3D WebGL 空间模型中...
顶层架构原则 · 物理完全解耦 · API 契约驱动

系统微服务拓扑与契约边界

Agent Runtime 底座与业务客户端彻底解耦,运行时数据与业务数据零牵扯。点击下方节点查看独立职责与数据流管线:

LIVE CLUSTER TOPOLOGY MAP (点击节点切换详情)
4 Microservices
:3001聚焦中

Agent Runtime 底座

NestJS / Express / Prisma / PostgreSQL

无业务侵入的通用 Agent 运行内核。负责 Session 状态机机管、ReAct 自主循环、4-Tier 动态模型路由与分层微沙箱。

:8000

认知记忆微服务

FastAPI / pgvector / tsvector (zhparser) / SQLAlchemy 2.0

独立的认知记忆中枢。结合 pgvector 向量检索与中文全文检索,提供 RRF 混合重排、GraphRAG 多跳实体关联与时序衰减。

:3001 (Web)

Trace 调试平台

Next.js / React / @tanstack/react-virtual

基于虚拟滚动构建的高性能可观测性控制台。实时展现 Token 水位计、Working Memory 补丁、Compaction Seam 压实查看与 A2A 看板。

:3005

小说创作平台应用

Next.js / PostgreSQL / Glassmorphism UI

业务应用消费端。拥有独立业务数据库(NovelProject, Chapters),通过标准 HTTP/SSE API 消费底座能力,具备断点续写长程跑批能力。

微服务间通信契约 (Active Pipelines)

xiaoshuoruntime(HTTP / SSE API (Port 3001))
小说业务端通过 Next.js 同源代理发送编排指令,接收单调自增的 SSE 打字机事件流。
runtimememory(Memory Tools API)
Agent 底座内核通过标准 Tool Call 协议向记忆微服务发起 RRF 检索与实体提取。
xiaoshuomemory(Ingestion / Retrieval)
小说大纲与章节入库时直连记忆服务建立实体关系与多模索引。
runtimeworkbench(Trace Telemetry & Specs)
底座将执行事件、Token 水位指标和 AgentSpec 元数据推送到虚拟滚动调试台。

Agent Runtime 底座

agent-runtime (NestJS :3001)

微服务核心职责与架构定位

无业务侵入的通用 Agent 运行内核。负责 Session 状态机机管、ReAct 自主循环、4-Tier 动态模型路由与分层微沙箱。

核心技术攻坚与亮点

物理与业务 100% 解耦,Schema 无小说特定字段
两阶段 Token 动态压实,零 400 Bad Request
Promise 串行化单调 seq 事件写库后广播
Google A2A 原生互联与 Supervisor 任务委派

实现能力与接口边界

  • Session 生命周期 (Suspend / Wakeup / Milestones)
  • Smart Model Router 4-Tier 动态分流
  • Tier 0~3 分层微沙箱执行与 CommandGuard
  • Scenario DAG 有向图编排与断点热重载
业务赋能 · 4 大企业级高价值落地场景

生产级 Agent 底座应用场景

将两阶段原子压实、DAG 断点编排、GraphRAG 认知记忆与 4-Tier 动态路由等核心工程能力,转化为解决行业复杂痛点的落地生产力。

长文本创作与 IP 宇宙资产管理

IP Universe & Long-Form Content Engine

适用行业与领域
网络文学平台游戏世界观/剧情设定剧本杀/动漫编剧虚拟人故事库
底座长程记忆与原子压实赋能态 (After)稳态生产

依托 GraphRAG 多跳实体拓扑、时空衰减剧透拦截与两阶段原子压实,实现百章长程自洽创作。

GraphRAG 2~3 Hop 实体关系链推理,精准联动主角、门派、法宝与剧情线索
基于剧情时间戳 (storyTime) 指数时空衰减函数 + Spoiler Blocker 硬性拦截超前设定
两阶段原子压实与 Compaction Seam 缝合线,确保 100+ 章节无限轮次无损续写
WritersCrew 多写手文风竞标打分机制 + CanonGuard 设定查重自愈闭环
底层激活的底座核心技术模块
Cognitive Memory微服务 :8000
pgvector + tsvector RRF 检索 & 时空衰减
Token Governance内核保护
两阶段原子压实 & Compaction Seam 缝合
BatchRunner业务调度
起止章节断点续写与状态机持久化
设定逻辑冲突率
< 0.5%
对比传统 18.6%
连续生成篇幅
100+ 章
支持任意起止断点
400 截断报错率
0.0%
两阶段原子保护
载入 3D 业务场景演进空间中...
实战沉淀 · 端到端企业级解决方案全景

行业级 AI Agent 落地解决方案

依托通用 Agent Runtime 底座与独立认知记忆中枢,实现长文本自动化生产、跨智能体开放互联与万级 Token 可观测治理。

长篇小说长文本自动化生成引擎

长文本与业务落地

XiaoShuo Studio · 100+ 章节长程一致性创作平台

针对大模型在数十万字长篇小说创作中出现的‘遗忘前文伏笔、设定冲突、文风漂移及多步长程批处理中断’等痛点,构建端到端自动化小说生产引擎。支持大纲推演、多写手竞标、正文润色与 EPUB 导出。

行业核心痛点与工程挑战 (Pain Points)

传统长文本上下文窗口易打满,直接引发 400 Bad Request 崩溃
长周期批量生成容易因单点网络波动中断,缺乏断点续写与容错机制
前后章节人物境界、招式、关系设定容易发生逻辑冲突与吃设定现象

架构设计与自研攻坚方案 (Tech Pillars)

BatchRunner 自动化长程跑批引擎,支持任意起止章节断点续写与状态机恢复
WritersCrew 多写手文风竞标评分打分机制,择优选择最佳行文风格
CanonGuard 设定冲突自愈中枢,结合 Memory Service 实时校验人物设定
Next.js 同源 Stream Proxy 解决跨端口 CORS 与 SSE 实时打字机渲染

核心量化业务成效 (Key Results)

连续生成篇幅
100+ 章节
设定逻辑冲突率
< 0.5%
断点续写恢复率
100%

涉及技术栈与核心模块

Next.jsFastAPIBatchRunnerWritersCrewCanonGuardEPUB
架构师评述 (Architect Note)

方案严格遵循高内聚、低耦合与物理隔离原则,所有业务编排均通过底座通用 API 完成,确保运行时内核的无污染与通用性复用。

硬核技术攻坚 · 解决大模型长多轮 400 Bad Request 顽疾

Token 水位预算治理与两阶段原子压实沙盘

传统暴力截断极易撕裂 Assistant-Tool 成对结构,引发 LLM API 400 崩溃。本系统自研原子 Turn 完整性算法与 Compaction Seam 缝合线,实现 4.8x 无损压实。

实时 Token 水位仿真滑块

预警水位 (Elevated)
水位: 68%87,040 / 128,000 Tokens
0% Normal70% Elevated85% High100% Critical
当前治理策略响应 (Action Taken)

对历史 Tool Result 超过 1500 tokens 的部分生成内存指针

预期无损压缩比:1.6x 压缩

Trace Timeline 实时步骤流

14:02:11 [User]"分析长篇小说第 1~15 章伏笔"Input
14:02:12 [Router]Tier 3 (Pro: Sonnet)TTFT 98ms
14:02:15 [Seam]Compaction Seam 注入-42,000 Tokens
14:02:18 [Tool]memory_search(query)18ms

源码级原理对比 (Code Comparison)

HistoryManager.ts (Production Code)TypeScript / NestJS
// ✅ 生产级原子 Turn 两阶段动态压实 (Atomic Turn + Compaction Seam)
function twoPhaseAtomicCompaction(messages: ChatMessage[], budget: number): ChatMessage[] {
  // 1. 识别不可拆分的完整“原子轮次” (User -> Assistant[ToolCalls] -> ToolResults)
  const atomicTurns = groupIntoAtomicTurns(messages);
  
  // 2. 第一阶段:大输出指针提炼 (Large Output Refinement)
  const prunedTurns = pruneToolOutputs(atomicTurns, MAX_TOOL_OUTPUT_TOKENS);
  
  // 3. 第二阶段:生成 Compaction Seam 缝合线,保护 Session 核心记忆
  if (calculateBudget(prunedTurns) > budget) {
    const { preservedTurns, historicalSummary } = compactHistoryWithSeam(prunedTurns);
    return [
      systemPrompt,
      { role: 'system', name: 'compaction_seam', content: historicalSummary },
      ...preservedTurns
    ];
  }
  return flattenTurns(prunedTurns); // 🛡️ 100% 保证 ToolCall 与 ToolResult 成对存在
}
架构师视角:为什么这是生产环境必备能力?

市面多数 Agent Demo 仅在 3~5 轮简短测试下表现良好,一旦进入包含上百轮 Tool Call 的真实业务场景(如长篇生成、代码库多步重构),上下文必定溢出。 通过原子 Turn 划分 + Compaction Seam 缝合,既保留了上下文的语义连贯性,又 100% 避免了因孤立 ToolCall 导致的 LLM API 400 崩溃。

算法自研深度 · 超越单纯向量检索的认知记忆中枢

认知记忆微服务与 GraphRAG 时空多跳沙盘

单纯向量检索缺乏实体关联推导,且在长篇场景中极易召回时序错乱的“剧透”。本服务融合 pgvector 向量 + tsvector 全文 RRF 双路重排,叠加剧情时空指数衰减与 2-Hop 实体链推导。

GraphRAG 实体多跳关系拓扑图

点击节点探查关联链
调查/敌对傀儡下属缴获专属信物外门弟子参与发生地林夜 (主角)黑水帮暗影议会幽夜徽记青云门金库潜入战
林夜 (主角)(Character)Core
当前直接关联实体:heishui, token, qingyun, event12

召回重排得分与剧透拦截 (Ranked Output)

RRF + Decay 模式
MEM-042plot
得分: 0.945

第 12 章:林夜潜入黑水帮地下金库,发现暗影议会留下的信物【幽夜徽记】,得知黑水帮受暗影议会操控。

距当前剧情 2 章前|RRF: 0.985×衰减: 0.96
MEM-089character
得分: 0.962

林夜:主角,身负幽冥灵脉,表面为青云门外门弟子,实则暗中调查家族被灭真相。

恒定核心设定|RRF: 0.962×衰减: 1
MEM-117faction
得分: 0.813

暗影议会:跨大陆的古老隐秘组织,由七位执事掌控,目前通过黑水帮控制江南十三州地下情报网络。

距当前剧情 5 章前|RRF: 0.924×衰减: 0.88
MEM-340plot
剧情时间戳违规 (剧透拦截)

【未来剧透剧情】第 80 章:暗影议会首领竟是青云门掌门陆乘风,林夜在此战中破境登仙。(当前进度:第 15 章)

未来 65 章后 (时间戳违规)
💡 核心对比结论:

RRF 综合全文关键词与向量语义,并通过 exp(-λ·Δt) 动态衰减远离当前故事节点的记忆,同时严格拦截大于当前剧情时间的未来实体,彻底解决大模型长文创作中的时空穿越与剧透错乱

智能动态模型路由 · 成本削减 60%+

4-Tier 动态模型路由器与成本大盘

杜绝所有请求一律无脑调用最贵模型的浪费行为。内置多维任务特征分类器(代码密度、推理深度、上下文体量、工具链),实现精准按需分流。

任务特征自适应分类演示

Smart Classifier
Incoming Prompt / Task:
"执行多步 ReAct 循环,调用 memory_search 和 docker_exec 并综合生成重构脚本"
动态分流目标梯队:Tier 3 (Pro)

高密度工具调用、严格 JSON 契约、代码生成,命中 Tier 3 高精度 Pro 模型。

分流准确率: 99.4%路由耗时: < 2ms

4-Tier 模型梯队与成本占比

综合降本 60%+
Tier 1 (Fast)$0.25 / M Tokens
Claude 3.5 Haiku / DeepSeek-V3
状态判断、关键词提炼、轻量路由占比 45%
Tier 2 (Standard)$0.60 / M Tokens
GPT-4o mini / Qwen-2.5-72B
常规对话、长上下文提取、设定查重占比 30%
Tier 3 (Pro)$3.00 / M Tokens
Claude 3.5 Sonnet / GPT-4o
核心逻辑编排、代码生成、多智能体协同占比 18%
Tier 4 (Reasoning)$5.00 / M Tokens
DeepSeek-R1 / OpenAI o1
复杂逻辑谜题、超长剧情伏笔推演占比 7%
📊 真实压测收益对比:全量使用 Claude 3.5 Sonnet 单一模型每月预算约 $1,200;引入 Smart Router 动态分流后,45% 任务由 Fast Tier 承接,总预算降至 $460(降幅达 61.6%),且复杂任务质量完全一致。
深度工程自研 · 分布式多智能体与沙箱执行

核心工程特性深度解密

涵盖 Scenario DAG 断点热重载编排、Tier 0~3 分层微沙箱纵深防御以及 Google A2A 开放互联协议。

Engine A: Scenario DAG Orchestrator

断点拦截、单步步过与运行时 Context 变量热注入

区别于传统黑盒执行的 LangGraph 或 CrewAI,本底座自研具备 IDE 级调试体验的 DAG 图执行器。支持在任意节点设置条件断点,挂起后可直接通过 API 实时修改运行时局部变量并步过恢复。

断点拦截挂起:执行流在指定节点自动中断,状态安全置为 paused_at_breakpoint
单步步过 (Step Over):精准控制单个节点的推进与下游分支求值
Context 变量热注入:在不重启 Session 的前提下修正错误中间态
DAG Debug Protocol (POST /api/scenarios/inject)
// 1. 发起变量热重载注入
POST /api/scenarios/session_882/inject
{
  "nodeId": "calculate_plot_climax",
  "injectContext": {
    "override_villain": "陆乘风",
    "climax_intensity": 9.8
  }
}

// 2. 响应: 状态变更为 RUNNING,从断点处继续步过
HTTP/1.1 200 OK
{
  "status": "resumed",
  "currentNode": "render_chapter_text",
  "stepSeq": 42
}
实事求是 · 生产级代码库成熟度与工程交付规范

功能成熟度矩阵与自动化交付体系

严格遵循 KISS 与第一性原理。全栈包含 Docker 容器化编排、Playwright 真实浏览器 UI 级 E2E 测试金字塔。

模块成熟度一览 (Maturity Matrix)

10 核心模块已落地
功能模块成熟度能力边界与说明
Session 生命周期与 ReAct 循环🟢 稳定 (Stable)支持挂起/唤醒、信号通知、快照回滚与 waiting_user_input 交互流转
SSE 打字机流与 after_seq 追赶🟢 稳定 (Stable)写库后广播,单调递增 seq,30s 断开重连自愈与宽限期
Smart Model Router 动态模型路由🟢 稳定 (Stable)任务特征多维分类器,4-Tier 动态分流,节约 60%+ Token 成本
Token 预算与两阶段原子压实🟢 稳定 (Stable)4 级水位线治理,原子 Turn 截断与 Compaction Seam 缝合线,根治 400 错误
Google A2A 协议与跨 Agent 互联🟢 稳定 (Stable)agent.json 名片发现、A2A 任务派发、Max-Hops 环路哨兵防死锁
pgvector + tsvector 混合检索 (RRF)🟢 稳定 (Stable)双路召回 + 倒数排名融合 + 剧情时空指数衰减与剧透拦截
Scenario DAG 有向图编排引擎🟢 稳定 (Stable)分支条件求值、断点拦截挂起、单步步过与 Context 变量热注入
Tier 0~3 分层微沙箱体系🟢 稳定 (Stable)SafeProxy -> WASM QuickJS -> Pyodide -> Docker 纵深防御与命令拦截
Trace 虚拟滚动全链路可观测控制台🟢 稳定 (Stable)基于 @tanstack/react-virtual 承载万级 Token 事件,水位仪表盘与 Seam 查看
GraphRAG 实体多跳关系推导🟡 可用 (Basic)支持 1~3 Hop 实体关系链推理与动态子图召回

UI 级 E2E 自动化测试规范

Playwright

拒绝仅靠单测 Mock 假象。制定标准 E2E Runbook:首先 Canary 预检数据库与模型连通性,随后启动真实 Chromium 浏览器进行 DOM 交互与 SSE 流断言。

npm run e2e:canary && npm run e2e:ui

一键容器化集群交付

Docker Compose

支持多数据库独立初始化(Prisma Runtime 库 vs PostgreSQL pgvector 业务库),带全链路健康探针检查。

docker compose -f docker-compose.prod.yml up -d