Python Agent / RAG 智能体研发 · 2026.03 — 2026.06
12306 智能数字员工
让对话式 Agent 负责理解、规划与协作,同时把交易事实和高风险动作留在可确认、可追踪的系统边界内。
01 / 系统边界
责任先于能力。
- 角色
- Python 对话编排层,负责理解请求、组织工具和上下文,并调用 Java 服务完成受控业务动作。
- 问题
- 多轮票务对话既要处理含糊意图与检索,也可能触发订票、退款等副作用;编排层不能绕过确认,更不能替代后端交易事实。
02 / 系统与评估视图
让意图、计划、确认、工具与评估各有记录。
这是一条语义化执行路径,不是对话截图:Agent 负责理解与编排,高风险动作需要确认,交易事实仍由 Java 服务持有。
01 / 输入
多轮请求与上下文
接收自然语言请求,并结合会话状态补足当前任务所需信息。02 / 路由
意图打分与查询改写
在 ACTION、TICKET、RAG 与 CHITCHAT 边界间路由,必要时改写检索查询。03 / 规划
计划与显式确认
高风险购票、退票动作进入确认态;失败时保留重试与 Replan 边界。04 / 工具
受控工具执行
标准 Tool Schema 约束参数,副作用去重避免同一意图被重复执行。05 / 系统
后端或混合检索
交易请求调用 Java 服务;规章问答进入 Milvus、OpenSearch 与重排链路。06 / 追踪
响应、追踪与回归
流式返回结果,并把计划、确认、执行、检索和失败样本留给离线评估。
- 200离线固定样例用例
- 离线确定性执行与安全矩阵,覆盖十类用例;200/200 只表示该固定样例测试框架全量通过,不衡量 LLM 计划生成准确率。
- 0.881 / 0.935上下文精确率 / 召回率
- 一轮历史 59 用例 strict-v2 RAG 评估,由 glm-4-plus 作为评审模型;这是上下文指标,不是整体回答准确率。
- 10执行与安全类别
- 覆盖工具选择、精确参数、确认、授权、提示注入、拒绝、多步执行、重试与 Replan 等回归边界。
方法边界这些记录来自历史离线评估,不代表生产效果或通用模型准确率;同一 59 用例运行的回答相关性(answer relevancy)为 0.424,低于配置阈值 0.8,仍是后续迭代边界。
03 / 工程方法
把关键机制放进可检查的路径。
- 01
路由与规划
把理解、规划与执行拆开
通过意图路由、查询改写、计划与执行节点组织多轮上下文、工具调用和流式回答,并在失败时支持重试与重新规划。 - 02
动作安全
让高风险动作显式确认
订票和退款动作需要明确确认,并通过重复副作用保护与会话控制避免同一意图被无意执行多次。 - 03
检索与评估
让答案与迭代都有证据
结合关键词与向量检索、融合重排和语义缓存回退,并以离线评估、消融对比、链路追踪和隐私化失败样本支撑迭代。
04 / 证据与结果
不靠虚构指标,呈现可验证的工程事实。
- 意图路由、查询改写与计划执行
- 显式确认与重复副作用保护
- Milvus + OpenSearch 混合检索与重排
- 天气 MCP、流式回答与重试 / 重规划
- 离线评估、可观察性与会话控制
形成一条有边界的对话协作路径:Agent 负责理解和编排,Java 服务继续作为交易事实来源。
查看共享仓库05 / 工程证据
从状态图走到真实交互与离线评估。
架构、查询、确认与评估证据按执行顺序排列;运行截图只说明对应交互步骤,离线报告只说明其固定数据集范围。
- 01架构
LangGraph 状态图与专家路由
公共主链连接 Query Refine、Intent Score、Semantic Cache 与 Context Bridge,再把任务交给 RAG、ACTION、TICKET、CHITCHAT 或组合路由。
来源 / python_agent/app/agent_graph.py 代码映射
证据边界架构图记录仓库代码中的编排与责任边界;交易事实仍由 Java 后端持有。
- 02运行界面
自然语言车票查询
运行界面记录自然语言问题进入 TICKET 路由并返回本地测试车次信息的过程,同时显示路由与上下文承接状态。
来源 / 本地 Python Agent 运行截图
证据边界该单次查询只证明图示测试流程可运行,不代表通用意图识别准确率或生产可用性。
- 03运行界面
高风险动作显式确认
购票意图在 ACTION 路由进入显式确认检查点,界面要求用户确认或取消后才继续执行。
来源 / 本地 Python Agent 运行截图
证据边界截图止于确认步骤,不证明订票、支付或退款已经完成。
- 04离线评估
200 例离线执行与安全矩阵
2026-07-23 报告中的 50 个手写核心用例与 150 个矩阵变体,在离线确定性 Executor 续接执行下记录为 200/200。
来源 / agent_eval_200_case_summary_20260723.json
证据边界该结果验证固定 fixtures 的执行与安全矩阵,不等同于 LLM Planner 生成质量、线上准确率或无人值守能力。
- 05离线评估
RAGAS 检索质量复评
2026-05-19 rerun2 使用 59 条 strict-v2 测试集与智谱 GLM-4-Plus judge,记录 context precision 0.881、context recall 0.935。
来源 / report_llm_judge_20260519_rerun2.json
证据边界这些是离线检索上下文指标,不是实时生产 SLA、整体回答准确率或通用模型能力结论。