AML AI 环节详图

输入信息 → 相关 AI / 算法技术 → 输出信息

基金 AML · PoC 技术说明

每一个 AI 环节,
都必须有清晰的输入、技术路径与可验收输出。

这不是“把数据丢给大模型”。不同任务应使用不同能力:结构化数据分析解决发现和排序,图谱解决关系与群组,LLM/RAG 解决资料阅读、解释和草拟;人工始终保留复核与处置权。

输入信息AI / 算法技术输出信息人工审核或边界
01

数据接入与客户全景档案

目标:让 AI 与调查人员看到同一个、可追溯的客户事实基础。

输入信息

客户与 KYC

客户 ID、证件/机构标识、开户日期、职业/行业、地址、联系方式、风险评级、受益人、代理人、渠道等。

基金交易与持仓

申购/赎回/转换、金额、份额、时间、产品、渠道、交易状态、持有周期等。

AML 历史资料

规则命中、预警、调查记录、人工结论、补件材料、处置和报送状态。

文档与制度

开户材料、尽调文件、访谈纪要、AML 制度、报告模板、已授权的历史案例。

相关 AI / 数据技术

ETL、数据质量与字段标准化

统一日期、金额、产品、渠道等口径;检查缺失、重复、异常值和更新时效。

实体解析 / 主数据匹配

用客户唯一标识为主;在姓名、地址、联系方式等存在变体时,用规则和相似度辅助识别同一实体,保留匹配置信度。

文档解析、OCR 与信息抽取

从 PDF、扫描件、表格、纪要中抽取结构化字段,如资金来源说明、受益人、地址与风险事件。

RAG 知识检索与 LLM 摘要

对制度、历史案例和客户文件做分段、嵌入、检索;LLM 仅基于检索到的材料生成客户背景摘要,并附来源。

输出信息

客户 360° 档案

统一客户视图:基础资料、历史交易、风险评级、预警、案件、关联实体及资料来源。

结构化事件时间线

开户、评级变化、申赎、预警、补件、人工处置按时间对齐。

数据质量与来源标签

字段完整度、最近更新时间、来源系统、实体匹配置信度与缺失项。

带引用的资料摘要

便于调查前阅读,但每段结论都能回到原文档或源系统记录。

PoC 可演示的例子

选择赵晓东后,系统在一个页面汇总:传统风险评级、近 24 个月申赎、最近渠道变化、0 条传统 AML 预警、开户资料中的地址信息,以及一份“调查前阅读摘要”。

人工与合规边界

  • 实体匹配存在不确定性时,应显示置信度并人工确认;
  • 客户资料、嵌入向量库、日志均应在客户受控环境处理;
  • LLM 摘要不能补造文件中没有的事实,必须显示引用。
02

全量主动风险发现与统一优先级排序

目标:发现未命中传统规则、但多个弱信号叠加后值得初筛的客户。

输入信息

全量活跃客户与历史交易

至少覆盖足以建立个人行为基线的时间窗口;按日/周/月聚合申赎频率、金额、产品、持有周期和渠道变化。

现有规则命中与静态风险

传统 AML 规则、客户风险等级、地区/行业/渠道等风险属性,用于保留既有覆盖并形成基线。

历史人工处置结果

预警最终结论、采纳/驳回原因、调查耗时。若标签偏少,主要用于评估和专家复核,而不是盲目训练模型。

关系和外部变化信号

客户关联字段、渠道变更、KYC 更新、名单/负面信息(仅限合法授权和适用的数据)。

相关 AI / 算法技术

规则引擎与组合规则

保留既有阈值规则;将多个弱信号作为“组合关注条件”,而不是立即覆盖或替换原有规则。

特征工程与个人基线

计算金额、频率、持有周期、产品偏好、渠道等的变化率、分位数、滚动窗口指标;重点比较“客户自己过去”而非只与全体平均值比。

异常检测 / 无监督学习

可选 Isolation Forest、LOF、聚类或稳健统计方法,为没有可靠标签的场景识别偏离模式;结果是异常度,不是洗钱概率。

监督模型与排序(条件具备时)

历史标签足够且质量可用时,可用 Logistic Regression、XGBoost 等预测“值得人工调查”的优先级;通过校准、时间切分和可解释性检验后使用。

统一风险评分 / Learning-to-Rank

将规则命中、行为异常、关系信号、静态风险合成排序分,区分“传统预警”和“AI 建议关注”的来源与原因。

输出信息

两类风险来源

传统规则预警队列 + AI 主动发现的待初筛客户队列,并保留来源标签。

统一优先级队列

按风险变化、证据强度、处理时限和业务影响排序,供调查资源分配使用。

风险贡献说明

例如:持有周期缩短贡献 31 分、渠道变化贡献 18 分、关联信号贡献 23 分。

监控指标

待初筛量、人工采纳率、升级调查率、误报工作量、风险分数分布与漂移。

赵晓东的示例

客户未触发大额、频繁、短期申赎等规则;但“持有周期缩短 64% + 渠道风险属性变化 + 间接地址关联”叠加后进入待初筛队列。AML 人员决定是否补件、持续观察或升级调查。

人工与模型边界

  • 异常分数不是“洗钱概率”,更不是可疑交易结论;
  • 必须用按时间切分的历史样本回测,防止使用结案后信息造成数据泄漏;
  • 模型阈值和队列容量应由 AML 业务与模型管理人员共同确认。
03

动态画像、关联网络与相似案例

目标:把单客户风险变化放到关系群组和历史经验中解释。

输入信息

实体与关系字段

客户、账户、地址、手机号、渠道、代理人、受益人、设备/IP(若合法可用)及其来源、有效期、可信度。

交易与行为事件

申赎时间、金额、产品、渠道、资金账户等;重点保留时间序列,识别同步、快进快出和分散/归集模式。

客户风险与案件标签

静态等级、规则命中、人工已确认的风险线索与处置结论;只能在权限范围内使用。

历史案例库

已脱敏、已授权的案件摘要、调查理由、核验措施和最终处置,用于相似案例检索。

相关 AI / 算法技术

实体解析与关系置信度

先解决“同一地址是否同一实体、字段是否过期”等质量问题;每条边记录来源、时间、强度和可信度。

图谱建模

构建节点(客户、地址、渠道、账户等)与边(共同属性、交易、代理、受益关系);可存于图数据库或关系表的图计算层。

图算法

社区发现(如 Louvain)、连通分量、中心性、多跳路径、时间窗口内的异常子图等,用于发现群组结构与关键枢纽。

相似度与案例检索

对结构化行为特征做相似度计算;对案例文本使用向量检索/RAG,寻找“模式相似但结论未必相同”的历史参考。

可解释性呈现

将图算法结果翻译成可复核句子:共同什么字段、何时发生、几跳关系、是否存在其他解释。

输出信息

客户动态风险画像

风险变化趋势、主要行为偏离、与历史/同类客群的对比及贡献原因。

待核验关联网络

群组、关键节点、多跳路径和共同属性;展示边来源、发生时间和置信度。

群组异常线索

同步申赎、共同渠道、异常社群、行为模式相似等,只作为调查线索。

相似案例参考

相关历史案件、相似原因、当时采用的核验动作和结论摘要,附检索依据。

PoC 可演示的例子

赵晓东与李明远等客户出现共同地址或间接关联。系统显示:该关系是“地址字段相同”、来源于开户资料、最近更新于何时;同时显示他们在 30 日窗口内是否存在相似申赎节奏。AML 人员据此决定核验地址真实性,而不是直接称为团伙。

人工与模型边界

  • 共同地址、同设备或相似交易均可能有合理业务解释,不能单独作为定性依据;
  • 要避免用低质量或未经授权的个人信息扩大关联范围;
  • 图谱可帮助调查,但基金公司数据不含完整银行资金流时,应明确其识别能力边界。
04

AI 调查助手:证据整理、追问与报告草拟

目标:减少调查人员在多个系统间搜集、阅读、对照和起草材料的时间。

输入信息

案件上下文

客户标识、调查目标、预警/主动发现来源、当前调查阶段(初筛或正式调查)、权限范围。

结构化证据包

KYC 摘要、关键交易、规则命中、风险分值贡献、图谱线索、人工已采纳/驳回的结论。

非结构化资料与知识库

开户文件、补件、访谈记录、制度、调查模板和已授权的历史案例;每项资料有访问权限与版本。

调查人员问题与操作

例如“为什么风险上升?”“需要补什么材料?”“生成时间线”“起草初筛摘要”。

相关 AI / 算法技术

混合 RAG 检索

关键词/BM25 适合查找制度条款和精确字段;向量检索适合语义相似内容;结果再按权限、时间、可信度重排。

LLM + 结构化提示词

把“事实、证据、待核验项、禁止推断、输出模板”固定为结构化上下文,减少泛化聊天与幻觉。

工具调用 / 工作流编排

让模型调用受控工具:查询交易汇总、获取时间线、读取图谱路径、检索制度,而不是把全部原始数据直接塞进上下文。

引用与事实一致性控制

回答要求携带来源 ID、字段或原文片段;无证据时明确“无法确认”;可增加规则校验和人工审批。

文档生成

按公司调查模板生成初筛摘要、待补件清单、访谈问题和报告初稿;内容保持可编辑并标记 AI 草稿。

输出信息

调查前材料包

客户背景、关键交易、规则/线索、资料缺口和来源链接的一页式摘要。

可追溯问答

对风险原因、关联关系、资料缺口的回答,按“已知事实—证据—不确定性—建议下一步”呈现。

待补件与核验清单

资金来源、交易目的、客户关系、渠道信息等建议核验项,可由人工勾选、修改和分派。

报告草稿

初筛摘要、调查报告或访谈提纲初稿,包含事实引用和待人工完善占位符。

建议的标准回答格式

已知事实
只陈述系统内已存在的资料
证据引用
链接至交易、文件、规则或图谱边
不确定性
明确哪些关系/资料尚未核验
人工下一步
给出补件、访谈或升级建议

大模型安全边界

  • 不允许模型编造客户事实、法律结论或报送建议;
  • 模型访问范围必须跟随调查人员权限,敏感字段可脱敏或最小化传入;
  • 提示词、模型版本、引用资料和人工修改都应保留审计记录。
05

效能复盘、人工反馈与经验回流

目标:让人工调查结论持续改善规则、风险排序、知识库与数据质量。

输入信息

案件与人工处置结果

初筛/调查结论、采纳或驳回的线索、补件结果、最终处置、关闭原因和审核意见。

规则与模型运行日志

规则命中、模型分数、特征贡献、阈值、版本、队列位置、处理时长和人工操作。

效果与运营指标

覆盖率、人工采纳率、升级率、误报工作量、SLA、调查耗时、不同渠道/客群的分布变化。

数据质量与反馈文本

字段缺失、实体匹配错误、关系边被驳回的原因、调查人员自由文本意见。

相关 AI / 算法技术

规则与模型效能评估

按时间、客群、渠道、规则类型比较采纳率、调查成本和风险覆盖;避免只看命中量或模型准确率。

数据漂移 / 概念漂移监控

监控交易金额、行为特征、风险分数和人工结论分布是否变化;识别旧规则、旧模型可能失效的信号。

人类反馈学习(Human Feedback)

将人工采纳/驳回和理由转为训练标签、特征评审依据或规则候选,而非把一次结论直接自动写回模型。

LLM 文本归纳

对大量调查意见、驳回理由和资料缺口进行主题聚类与摘要,发现反复出现的规则盲区或流程痛点。

MLOps / 规则治理

版本管理、审批、离线回测、灰度试运行、效果复评和回滚机制,确保改动可审计、可恢复。

输出信息

效能仪表板

对比传统规则与 AI 主动发现:初筛量、采纳率、升级调查率、时效、人工工作量与新增线索。

候选优化建议

例如新增组合风险因子、调整排序阈值、改进待补件模板、补充关系字段或治理数据质量。

知识库更新候选

将经审核的调查经验、核验问题和案例模式纳入 RAG 知识库或标准作业清单。

变更与验证记录

每项建议的提出人、依据、审批、回测/灰度结果、生效版本和回滚方案。

回流示例

若“持有周期显著缩短 + 渠道变化”的 AI 主动发现案例,经人工初筛后有较高采纳率,系统提出候选建议:将其纳入统一排序因子。该建议先由 AML 与模型管理员审阅,再在历史样本回测和小范围灰度验证后生效。

不可自动化的变更

  • 不能因一次案件结论自动改变阈值、模型权重或客户风险等级;
  • 任何训练数据、规则变更和知识库更新都需版本化、审批和效果复评;
  • 应监控是否对特定客群造成不合理偏差或新增无效工作量。