LYC邮箱

Python Agent / RAG 智能体研发 · 2026.03 — 2026.06

12306 智能数字员工

让对话式 Agent 负责理解、规划与协作,同时把交易事实和高风险动作留在可确认、可追踪的系统边界内。

责任先于能力。

角色
Python 对话编排层,负责理解请求、组织工具和上下文,并调用 Java 服务完成受控业务动作。
问题
多轮票务对话既要处理含糊意图与检索,也可能触发订票、退款等副作用;编排层不能绕过确认,更不能替代后端交易事实。

02 / 系统与评估视图

让意图、计划、确认、工具与评估各有记录。

这是一条语义化执行路径,不是对话截图:Agent 负责理解与编排,高风险动作需要确认,交易事实仍由 Java 服务持有。

  1. 01 / 输入

    多轮请求与上下文

    接收自然语言请求,并结合会话状态补足当前任务所需信息。
  2. 02 / 路由

    意图打分与查询改写

    在 ACTION、TICKET、RAG 与 CHITCHAT 边界间路由,必要时改写检索查询。
  3. 03 / 规划

    计划与显式确认

    高风险购票、退票动作进入确认态;失败时保留重试与 Replan 边界。
  4. 04 / 工具

    受控工具执行

    标准 Tool Schema 约束参数,副作用去重避免同一意图被重复执行。
  5. 05 / 系统

    后端或混合检索

    交易请求调用 Java 服务;规章问答进入 Milvus、OpenSearch 与重排链路。
  6. 06 / 追踪

    响应、追踪与回归

    流式返回结果,并把计划、确认、执行、检索和失败样本留给离线评估。
200离线固定样例用例
离线确定性执行与安全矩阵,覆盖十类用例;200/200 只表示该固定样例测试框架全量通过,不衡量 LLM 计划生成准确率。
0.881 / 0.935上下文精确率 / 召回率
一轮历史 59 用例 strict-v2 RAG 评估,由 glm-4-plus 作为评审模型;这是上下文指标,不是整体回答准确率。
10执行与安全类别
覆盖工具选择、精确参数、确认、授权、提示注入、拒绝、多步执行、重试与 Replan 等回归边界。

方法边界这些记录来自历史离线评估,不代表生产效果或通用模型准确率;同一 59 用例运行的回答相关性(answer relevancy)为 0.424,低于配置阈值 0.8,仍是后续迭代边界。

把关键机制放进可检查的路径。

  1. 01

    路由与规划

    把理解、规划与执行拆开

    通过意图路由、查询改写、计划与执行节点组织多轮上下文、工具调用和流式回答,并在失败时支持重试与重新规划。
  2. 02

    动作安全

    让高风险动作显式确认

    订票和退款动作需要明确确认,并通过重复副作用保护与会话控制避免同一意图被无意执行多次。
  3. 03

    检索与评估

    让答案与迭代都有证据

    结合关键词与向量检索、融合重排和语义缓存回退,并以离线评估、消融对比、链路追踪和隐私化失败样本支撑迭代。

不靠虚构指标,呈现可验证的工程事实。

  • 意图路由、查询改写与计划执行
  • 显式确认与重复副作用保护
  • Milvus + OpenSearch 混合检索与重排
  • 天气 MCP、流式回答与重试 / 重规划
  • 离线评估、可观察性与会话控制

形成一条有边界的对话协作路径:Agent 负责理解和编排,Java 服务继续作为交易事实来源。

查看共享仓库

05 / 工程证据

架构、查询、确认与评估证据按执行顺序排列;运行截图只说明对应交互步骤,离线报告只说明其固定数据集范围。

  1. 01架构

    LangGraph 状态图与专家路由

    公共主链连接 Query Refine、Intent Score、Semantic Cache 与 Context Bridge,再把任务交给 RAG、ACTION、TICKET、CHITCHAT 或组合路由。

    来源 / python_agent/app/agent_graph.py 代码映射

    证据边界架构图记录仓库代码中的编排与责任边界;交易事实仍由 Java 后端持有。

  2. 02运行界面

    自然语言车票查询

    运行界面记录自然语言问题进入 TICKET 路由并返回本地测试车次信息的过程,同时显示路由与上下文承接状态。

    来源 / 本地 Python Agent 运行截图

    证据边界该单次查询只证明图示测试流程可运行,不代表通用意图识别准确率或生产可用性。

  3. 03运行界面

    高风险动作显式确认

    购票意图在 ACTION 路由进入显式确认检查点,界面要求用户确认或取消后才继续执行。

    来源 / 本地 Python Agent 运行截图

    证据边界截图止于确认步骤,不证明订票、支付或退款已经完成。

  4. 04离线评估

    200 例离线执行与安全矩阵

    2026-07-23 报告中的 50 个手写核心用例与 150 个矩阵变体,在离线确定性 Executor 续接执行下记录为 200/200。

    来源 / agent_eval_200_case_summary_20260723.json

    证据边界该结果验证固定 fixtures 的执行与安全矩阵,不等同于 LLM Planner 生成质量、线上准确率或无人值守能力。

  5. 05离线评估

    RAGAS 检索质量复评

    2026-05-19 rerun2 使用 59 条 strict-v2 测试集与智谱 GLM-4-Plus judge,记录 context precision 0.881、context recall 0.935。

    来源 / report_llm_judge_20260519_rerun2.json

    证据边界这些是离线检索上下文指标,不是实时生产 SLA、整体回答准确率或通用模型能力结论。