输入信息
客户 ID、证件/机构标识、开户日期、职业/行业、地址、联系方式、风险评级、受益人、代理人、渠道等。
申购/赎回/转换、金额、份额、时间、产品、渠道、交易状态、持有周期等。
规则命中、预警、调查记录、人工结论、补件材料、处置和报送状态。
开户材料、尽调文件、访谈纪要、AML 制度、报告模板、已授权的历史案例。
输入信息 → 相关 AI / 算法技术 → 输出信息
基金 AML · PoC 技术说明
这不是“把数据丢给大模型”。不同任务应使用不同能力:结构化数据分析解决发现和排序,图谱解决关系与群组,LLM/RAG 解决资料阅读、解释和草拟;人工始终保留复核与处置权。
目标:让 AI 与调查人员看到同一个、可追溯的客户事实基础。
客户 ID、证件/机构标识、开户日期、职业/行业、地址、联系方式、风险评级、受益人、代理人、渠道等。
申购/赎回/转换、金额、份额、时间、产品、渠道、交易状态、持有周期等。
规则命中、预警、调查记录、人工结论、补件材料、处置和报送状态。
开户材料、尽调文件、访谈纪要、AML 制度、报告模板、已授权的历史案例。
统一日期、金额、产品、渠道等口径;检查缺失、重复、异常值和更新时效。
用客户唯一标识为主;在姓名、地址、联系方式等存在变体时,用规则和相似度辅助识别同一实体,保留匹配置信度。
从 PDF、扫描件、表格、纪要中抽取结构化字段,如资金来源说明、受益人、地址与风险事件。
对制度、历史案例和客户文件做分段、嵌入、检索;LLM 仅基于检索到的材料生成客户背景摘要,并附来源。
统一客户视图:基础资料、历史交易、风险评级、预警、案件、关联实体及资料来源。
开户、评级变化、申赎、预警、补件、人工处置按时间对齐。
字段完整度、最近更新时间、来源系统、实体匹配置信度与缺失项。
便于调查前阅读,但每段结论都能回到原文档或源系统记录。
选择赵晓东后,系统在一个页面汇总:传统风险评级、近 24 个月申赎、最近渠道变化、0 条传统 AML 预警、开户资料中的地址信息,以及一份“调查前阅读摘要”。
目标:发现未命中传统规则、但多个弱信号叠加后值得初筛的客户。
至少覆盖足以建立个人行为基线的时间窗口;按日/周/月聚合申赎频率、金额、产品、持有周期和渠道变化。
传统 AML 规则、客户风险等级、地区/行业/渠道等风险属性,用于保留既有覆盖并形成基线。
预警最终结论、采纳/驳回原因、调查耗时。若标签偏少,主要用于评估和专家复核,而不是盲目训练模型。
客户关联字段、渠道变更、KYC 更新、名单/负面信息(仅限合法授权和适用的数据)。
保留既有阈值规则;将多个弱信号作为“组合关注条件”,而不是立即覆盖或替换原有规则。
计算金额、频率、持有周期、产品偏好、渠道等的变化率、分位数、滚动窗口指标;重点比较“客户自己过去”而非只与全体平均值比。
可选 Isolation Forest、LOF、聚类或稳健统计方法,为没有可靠标签的场景识别偏离模式;结果是异常度,不是洗钱概率。
历史标签足够且质量可用时,可用 Logistic Regression、XGBoost 等预测“值得人工调查”的优先级;通过校准、时间切分和可解释性检验后使用。
将规则命中、行为异常、关系信号、静态风险合成排序分,区分“传统预警”和“AI 建议关注”的来源与原因。
传统规则预警队列 + AI 主动发现的待初筛客户队列,并保留来源标签。
按风险变化、证据强度、处理时限和业务影响排序,供调查资源分配使用。
例如:持有周期缩短贡献 31 分、渠道变化贡献 18 分、关联信号贡献 23 分。
待初筛量、人工采纳率、升级调查率、误报工作量、风险分数分布与漂移。
客户未触发大额、频繁、短期申赎等规则;但“持有周期缩短 64% + 渠道风险属性变化 + 间接地址关联”叠加后进入待初筛队列。AML 人员决定是否补件、持续观察或升级调查。
目标:把单客户风险变化放到关系群组和历史经验中解释。
客户、账户、地址、手机号、渠道、代理人、受益人、设备/IP(若合法可用)及其来源、有效期、可信度。
申赎时间、金额、产品、渠道、资金账户等;重点保留时间序列,识别同步、快进快出和分散/归集模式。
静态等级、规则命中、人工已确认的风险线索与处置结论;只能在权限范围内使用。
已脱敏、已授权的案件摘要、调查理由、核验措施和最终处置,用于相似案例检索。
先解决“同一地址是否同一实体、字段是否过期”等质量问题;每条边记录来源、时间、强度和可信度。
构建节点(客户、地址、渠道、账户等)与边(共同属性、交易、代理、受益关系);可存于图数据库或关系表的图计算层。
社区发现(如 Louvain)、连通分量、中心性、多跳路径、时间窗口内的异常子图等,用于发现群组结构与关键枢纽。
对结构化行为特征做相似度计算;对案例文本使用向量检索/RAG,寻找“模式相似但结论未必相同”的历史参考。
将图算法结果翻译成可复核句子:共同什么字段、何时发生、几跳关系、是否存在其他解释。
风险变化趋势、主要行为偏离、与历史/同类客群的对比及贡献原因。
群组、关键节点、多跳路径和共同属性;展示边来源、发生时间和置信度。
同步申赎、共同渠道、异常社群、行为模式相似等,只作为调查线索。
相关历史案件、相似原因、当时采用的核验动作和结论摘要,附检索依据。
赵晓东与李明远等客户出现共同地址或间接关联。系统显示:该关系是“地址字段相同”、来源于开户资料、最近更新于何时;同时显示他们在 30 日窗口内是否存在相似申赎节奏。AML 人员据此决定核验地址真实性,而不是直接称为团伙。
目标:减少调查人员在多个系统间搜集、阅读、对照和起草材料的时间。
客户标识、调查目标、预警/主动发现来源、当前调查阶段(初筛或正式调查)、权限范围。
KYC 摘要、关键交易、规则命中、风险分值贡献、图谱线索、人工已采纳/驳回的结论。
开户文件、补件、访谈记录、制度、调查模板和已授权的历史案例;每项资料有访问权限与版本。
例如“为什么风险上升?”“需要补什么材料?”“生成时间线”“起草初筛摘要”。
关键词/BM25 适合查找制度条款和精确字段;向量检索适合语义相似内容;结果再按权限、时间、可信度重排。
把“事实、证据、待核验项、禁止推断、输出模板”固定为结构化上下文,减少泛化聊天与幻觉。
让模型调用受控工具:查询交易汇总、获取时间线、读取图谱路径、检索制度,而不是把全部原始数据直接塞进上下文。
回答要求携带来源 ID、字段或原文片段;无证据时明确“无法确认”;可增加规则校验和人工审批。
按公司调查模板生成初筛摘要、待补件清单、访谈问题和报告初稿;内容保持可编辑并标记 AI 草稿。
客户背景、关键交易、规则/线索、资料缺口和来源链接的一页式摘要。
对风险原因、关联关系、资料缺口的回答,按“已知事实—证据—不确定性—建议下一步”呈现。
资金来源、交易目的、客户关系、渠道信息等建议核验项,可由人工勾选、修改和分派。
初筛摘要、调查报告或访谈提纲初稿,包含事实引用和待人工完善占位符。
目标:让人工调查结论持续改善规则、风险排序、知识库与数据质量。
初筛/调查结论、采纳或驳回的线索、补件结果、最终处置、关闭原因和审核意见。
规则命中、模型分数、特征贡献、阈值、版本、队列位置、处理时长和人工操作。
覆盖率、人工采纳率、升级率、误报工作量、SLA、调查耗时、不同渠道/客群的分布变化。
字段缺失、实体匹配错误、关系边被驳回的原因、调查人员自由文本意见。
按时间、客群、渠道、规则类型比较采纳率、调查成本和风险覆盖;避免只看命中量或模型准确率。
监控交易金额、行为特征、风险分数和人工结论分布是否变化;识别旧规则、旧模型可能失效的信号。
将人工采纳/驳回和理由转为训练标签、特征评审依据或规则候选,而非把一次结论直接自动写回模型。
对大量调查意见、驳回理由和资料缺口进行主题聚类与摘要,发现反复出现的规则盲区或流程痛点。
版本管理、审批、离线回测、灰度试运行、效果复评和回滚机制,确保改动可审计、可恢复。
对比传统规则与 AI 主动发现:初筛量、采纳率、升级调查率、时效、人工工作量与新增线索。
例如新增组合风险因子、调整排序阈值、改进待补件模板、补充关系字段或治理数据质量。
将经审核的调查经验、核验问题和案例模式纳入 RAG 知识库或标准作业清单。
每项建议的提出人、依据、审批、回测/灰度结果、生效版本和回滚方案。
若“持有周期显著缩短 + 渠道变化”的 AI 主动发现案例,经人工初筛后有较高采纳率,系统提出候选建议:将其纳入统一排序因子。该建议先由 AML 与模型管理员审阅,再在历史样本回测和小范围灰度验证后生效。