项目经验

我们做过的企业项目

从金融风控、能源预测,到体育科技、推荐平台、工业视觉与大模型应用。了解业务数据如何进入模型、预测结果如何用于工作,以及实施时需要验证什么。

合作单位

  • 国家电网
  • 招商银行
  • 华泰证券
  • FITURE 沸彻
  • 重庆理工大学
  • 重庆交通大学
  • 台灣土地
  • 阿里云
年份
2021—2022
行业
金融
方向
风控建模
状态
已交付

案例 01 · 招商银行

小额贷款催收风控模型

为招商银行小额贷款业务研发并部署催收模型,与客户数据流全面对接。

用数据挖掘算法构建特征,采用评分卡模型,并在大规模样本上结合机器学习方法,兼顾模型的稳定性和泛化能力。上线后违约率降低 8%,需要人工审核的量降至部署前的 32%。

8%违约率降低
32%人工审核量为部署前的

业务难点

催收资源有限,但不同客户的风险并不相同。业务记录不能直接作为稳定的风险依据;模型还要兼顾风险识别、审核成本与上线后的表现。

数据挖掘 → 风险建模 → 业务分流
  1. 01

    业务数据

    • 客户业务数据流

    形成可用于建模的样本

  2. 02

    特征构建

    • 数据挖掘
    • 业务特征构建

    提取可重复计算的风险信号

  3. 03

    风险建模

    • 评分卡模型
    • 大规模样本机器学习

    把客户差异转为风险分层

  4. 04

    业务接入

    • 模型部署
    • 审核分流

    支持审核资源分配

架构沿用现有项目技术路线;下文展开各环节的技术作用与验证方法。

关键技术:解决什么,为什么有效

技术设计 01

特征工程:把原始记录转成风险信号

难点
业务记录粒度不一,直接输入模型容易混入噪声,甚至包含预测时点之后的信息。
技术路径
项目以数据挖掘构建特征。技术设计重点是先界定观察窗口与风险标签,再形成可重复计算的业务变量;例如频次、间隔和变化趋势都必须以预测时点为界。
作用与验证
让模型比较的是当时可获得的风险信号,减少离线效果很好、上线失效的偏差。
技术设计 02

评分卡与机器学习:连接预测与审核策略

难点
风险分数只有转成业务可执行的分流规则,才能改变审核效率。
技术路径
既有路线采用评分卡,并结合大规模样本上的机器学习方法。评分卡便于组织稳定的风险分层,机器学习用于学习更复杂的变量关系;具体组合方式应随样本与业务约束验证。
作用与验证
按风险分层配置人工审核资源,同时检查分流阈值下的风险覆盖与误判成本。

交付与成效

已研发部署并对接客户数据流。现有项目记录:上线后违约率降低 8%,人工审核量降至部署前的 32%。这两个指标描述整体项目成效,不等同于某一模型单独带来的收益。

查看评估与验收要点

先定义预测时点

评估这类模型时,先明确要预测的事件和时间范围;特征只能使用当时已经知道的信息,避免把事后结果带入训练。

用业务成本选择阈值

模型评分还要转成审核规则。验证时同时看风险识别、误判和人工审核量,再按业务可接受的损失确定分流阈值。

年份
2022
行业
能源
方向
时间序列预测
状态
已完成

案例 02 · 国家电网

水电站入库流量与发电曲线预测

研发并部署水电站入库流量预测与发电曲线预测模型。

采集流域沿线多个气象站点和遥感数据,系统分析入库流量与各站点数据之间的关系,使用 DeepAR、Time-Transformer、GBDT 等多种模型融合预测。

业务难点

上游不同站点的气象变化,对水库入流的影响存在时间差;流量又随季节与天气变化。只看单站点或历史流量,难以完整表达流域变化。

多源观测与多模型融合预测
  1. 01

    观测输入

    • 沿线气象站
    • 遥感数据

    汇集流域相关观测

  2. 02

    关联分析

    • 入库流量
    • 站点与时序关系

    形成预测输入

  3. 03

    并行建模与融合

    • DeepAR
    • Time-Transformer
    • GBDT

    融合不同模型的预测

  4. 04

    预测输出

    • 入库流量
    • 发电曲线

    为生产与调度提供参考

架构沿用现有项目技术路线;下文展开各环节的技术作用与验证方法。

关键技术:解决什么,为什么有效

技术设计 01

多源关联分析:识别不同站点的贡献

难点
各站点观测与遥感信息分布在不同时间、空间尺度,不能简单拼表后直接训练。
技术路径
项目汇集沿线多个气象站和遥感数据,分析它们与入库流量的关系。进一步展开时,需要对齐采样时间、区分缺测,并比较不同滞后窗口的关联;只能使用预测当时可取得的数据。
作用与验证
把上游变化转成有时间含义的预测输入,减少错位观测和未来信息造成的误差。
技术设计 02

DeepAR + Time-Transformer + GBDT:互补建模

难点
周期性变化、跨时间关联与气象变量的非线性影响,需要不同的表达能力。
技术路径
既有项目采用三类模型融合:DeepAR 学习自回归时序规律;Time-Transformer 路线建模时序关联;GBDT 处理结构化特征及其交互。融合应依据滚动回测结果选择,而非简单平均。
作用与验证
利用不同模型的误差差异缓解单模型偏差,分别检查枯水期、丰水期和峰值变化,确认融合是否有效。

交付与成效

已完成入库流量与发电曲线预测模型的研发部署,为生产与调度提供预测参考。现有材料未提供可公开的误差降幅或发电收益;验收可围绕分时段误差、峰值偏差和不同预测时长展开。

查看评估与验收要点

按时间推进验证

预测模型应按过去训练、未来验证的顺序回测;分别检查不同预测时长与季节,避免随机打散时间序列带来的乐观结果。

看清模型各自的作用

DeepAR 与 Time-Transformer 用于学习时序变化,GBDT 用于特征建模。融合效果需要与单模型及简单基线比较,并检查极端天气、缺测时的误差。

年份
2021
行业
体育科技
方向
计算机视觉
状态
已交付

案例 03

高尔夫 AI 教练系统

用手机或工业摄像头采集挥杆视频,实时分析人体姿态,给出评分并纠正动作。

底层为迁移训练的高尔夫球检测模型与人体关键点检测模型,并用跨帧动力学算法对检测结果进行修正和平滑。

业务难点

挥杆速度快、球目标小,手机拍摄还会遇到遮挡与运动模糊。单帧检测即使大体正确,关键点的细小抖动也可能被误判成动作变化。

从视频帧到动作反馈
  1. 01

    视频采集

    • 手机
    • 工业摄像头

    连续挥杆画面

  2. 02

    视觉检测

    • 迁移训练:球检测
    • 人体关键点检测

    球位置与人体姿态

  3. 03

    时序修正

    • 跨帧动力学
    • 修正与平滑

    缓解单帧抖动与检测跳变

  4. 04

    动作分析

    • 实时评分
    • 动作纠正

    可理解的训练反馈

架构沿用现有项目技术路线;下文展开各环节的技术作用与验证方法。

关键技术:解决什么,为什么有效

技术设计 01

迁移训练 + 双路视觉检测

难点
通用视觉模型不天然适应高尔夫球和挥杆姿态,球与人体也需要不同的检测目标。
技术路径
项目分别使用迁移训练的高尔夫球检测模型与人体关键点检测模型,提取球位置和人体姿态。这样可以分别处理小目标定位与关节位置估计,再进入动作分析。
作用与验证
把场景适配与动作表示分开处理,避免仅凭整幅画面的分类结果给出动作反馈。
技术设计 02

跨帧动力学:从离散点得到连贯动作

难点
偶发漏检或位置跳动会放大为角度、速度等动作特征的异常。
技术路径
项目用跨帧动力学算法修正、平滑检测结果,利用相邻帧的运动连续性约束单帧输出。设计时需权衡平滑强度与反馈延迟,避免把快速挥杆本身的变化抹掉。
作用与验证
在连续轨迹上形成评分与纠正反馈;验证同时看轨迹稳定性、快速动作保真度和端到端时延。

交付与成效

已交付支持手机或工业摄像头采集的 AI 教练系统,实现实时姿态分析、评分与动作纠正。具体检测精度与时延数值未在现有材料中披露。

查看评估与验收要点

单帧准确还不够

遮挡、运动模糊和检测抖动会影响动作判断。跨帧处理利用连续画面的关系修正检测结果,使反馈建立在连贯动作上。

按使用环境验收

验证这类系统,需要覆盖拍摄角度、光照、挥杆速度及遮挡,并同时检查姿态误差和端到端反馈延迟。

年份
2021
行业
AI 平台
方向
自研平台
状态
已交付

案例 04

森罗 AutoML 自动化机器学习平台

面向非算法专业用户的自动化机器学习平台,用可视化界面完成从数据到模型的全流程。

统一主流机器学习/深度学习算法接口,集成数据预处理与特征工程;支持分布式内存计算,模型可导出部署到 Spark、Kafka、Flink 等生产评分环境。

业务难点

企业建模常卡在数据清洗、算法接口不一致和部署衔接上。即使训练出了模型,生产环境中字段、预处理或运行方式不同,也会让预测无法稳定复现。

从可视化建模到生产评分
  1. 01

    数据接入

    • SQL/文件
    • HDFS/S3/NFS

    统一加载数据

  2. 02

    数据与特征

    • 探索分析/预处理
    • 特征工程与选择

    可复用的数据处理流程

  3. 03

    模型选择

    • 统一算法接口
    • 分布式内存计算
    • 模型评估与选择

    选定模型及处理方式

  4. 04

    部署评分

    • POJO/MOJO 导出
    • 生产环境接入

    在业务数据上执行预测

架构沿用现有项目技术路线;下文展开各环节的技术作用与验证方法。

关键技术:解决什么,为什么有效

技术设计 01

统一算法接口 + 可复用特征流程

难点
不同算法需要各自适配,非算法用户难以重复完成预处理、训练与比较。
技术路径
平台统一主流机器学习与深度学习接口,集成数据预处理、特征工程、特征选择与模型评估;用可视化流程串联数据接入到模型选择,并支持分布式内存计算。
作用与验证
降低反复编写数据与模型衔接代码的工作量,把算法比较放在一致的数据处理流程中。
技术设计 02

模型制品导出:打通训练与生产评分

难点
训练环境与生产系统相互依赖,容易增加部署成本,也容易出现输入定义不一致。
技术路径
平台支持 POJO/MOJO 模型导出,衔接 Spark、Kafka、Flink 等生产评分环境。工程核对需要覆盖字段类型、特征顺序和预处理规则,并以同一批输入比较训练端与生产端结果。
作用与验证
将模型选择与业务运行衔接起来,按批量或流式负载选择评分方式,减少重新实现模型逻辑的风险。

交付与成效

已交付面向非算法专业用户的可视化 AutoML 平台,覆盖数据接入、特征处理、建模评估和模型导出。支持范围以实际算法与运行环境为准,不将自动建模等同于免去业务验证。

查看评估与验收要点

把预处理一起交付

模型依赖字段类型、缺失值处理和特征顺序。部署时需要连同数据处理方式核对,保证训练与生产评分使用一致的输入含义。

按实际负载选择运行方式

定时评分可走批处理;需要连续更新的场景再考虑流式接入。选择环境时结合现有系统、延迟要求和运维能力。

查看平台技术栈与部署架构 ↗
年份
2021
行业
内容与社区
方向
推荐系统
状态
已交付

案例 05

万象多模态推荐算法平台

整合视频、语音、文字、社区关系和操作历史等多模态信息的推荐算法平台。

基于计算机视觉、自然语言处理和图挖掘技术建立多模态表示;召回与排序模型冷热互备,并用海量数据预训练支持冷启动。

业务难点

内容同时包含文字、视频和语音,用户兴趣还体现在关系与操作历史中。新用户、新内容缺少行为信号,仅依靠点击记录会限制推荐覆盖。

多模态内容如何进入推荐结果
  1. 01

    多模态输入

    • 文字/视频/语音
    • 关系与操作历史

    内容与用户行为信号

  2. 02

    表示学习

    • 计算机视觉/NLP
    • 图挖掘
    • 预训练支持冷启动

    补充行为稀疏时的内容信号

  3. 03

    候选选择

    • 召回
    • 排序

    先筛选候选,再比较优先级

  4. 04

    推荐输出

    • 个性化推荐
    • 模型冷热互备

    向应用返回推荐内容

架构沿用现有项目技术路线;下文展开各环节的技术作用与验证方法。

关键技术:解决什么,为什么有效

技术设计 01

多模态表示 + 图挖掘

难点
单一文本标签无法表达视频、语音的内容,也难以利用社区关系。
技术路径
平台结合计算机视觉、自然语言处理和图挖掘,将内容特征与关系、行为信号纳入推荐表示;海量数据预训练用于支持缺少交互记录时的冷启动。
作用与验证
在行为数据不足时仍有内容侧信号可用;内容表示与用户历史相结合,为候选选择提供更丰富的依据。
技术设计 02

召回与排序分层 + 模型冷热互备

难点
全量内容逐一精排代价高,而只追求计算速度又可能遗漏有价值的候选。
技术路径
既有架构将召回与排序分开:召回缩小候选范围,排序比较候选与用户的匹配程度;同时支持模型冷热互备。验证需分别检查候选覆盖、排序质量与切换可用性。
作用与验证
把候选覆盖、计算量和展示顺序分层处理,避免用一个模型同时承担全部推荐任务。

交付与成效

已交付多模态推荐算法平台,具备多源内容与行为建模、召回排序及冷启动支持能力。现有材料未披露点击率或转化率提升,实际收益应通过业务对照验证。

查看评估与验收要点

拆开召回与排序

召回解决候选覆盖,排序解决展示顺序。评估时分别检查候选是否找全、排序是否有效,避免只用一个点击指标判断整个系统。

单独检查新内容与新用户

缺少行为记录时,内容表示和预训练能力更重要。冷启动效果应单独验证,同时关注推荐多样性和重复内容。

查看多模态推荐平台架构 ↗
年份
2025
行业
工业制造
方向
工业视觉
状态
开发完成

案例 06

视觉质检与智能分拣

面向工业现场的视觉质检与智能分拣项目,已完成开发。

从产线图像中识别缺陷,并将质检判定与分拣执行联动。

业务难点

工业缺陷通常样本少、形态差异大,材质反光与光照变化又可能被误判为缺陷。判定结果还必须在产线节拍内对应到正确工件。

视觉质检与分拣联动参考流程
  1. 01

    采集与标识

    • 产线图像
    • 工件标识

    让画面对应具体工件

  2. 02

    缺陷分析

    • 目标检测/分割选型
    • 缺陷位置与类别

    生成缺陷判断依据

  3. 03

    质量判定

    • 判定规则
    • 异常复核

    形成质检结果

  4. 04

    分拣联动

    • 工件标识与指令关联
    • 分拣回执/异常处置

    核对结果与实际分拣

参考实施方案;具体模型、设备和系统接口需按项目条件确定。

关键技术:解决什么,为什么有效

技术设计 01

缺陷标准 + 分层样本验证

难点
把不同批次的近似图像随机混入训练与测试,可能掩盖对新批次、材质的适应问题。
技术路径
参考设计先统一缺陷类别与允许范围,按批次、材料、工位拆分样本;根据缺陷形态选择目标检测或像素级分割。对难例单独复核标注,再按缺陷类型调节判定阈值。
作用与验证
将漏检与误检落实到具体缺陷,区分采集问题、标注分歧与模型不足,明确下一步改进位置。
技术设计 02

工件追踪 + 分拣执行反馈

难点
图像识别正确,并不代表分拣机构处理了同一件产品。
技术路径
参考架构把采集时间、工件标识、缺陷位置、判定结果贯通到分拣指令;结合工件到达执行位置的时间检查延迟,并记录执行回执,异常情况转人工处置。
作用与验证
把视觉模型接入完整的检测—判定—执行链路,按真实节拍验证结果与实物是否一致。

交付与成效

现有项目记录确认视觉质检与智能分拣开发完成。上述为技术展开的参考设计;具体网络、设备接口与漏检率未披露,需以现场验证数据确认。

查看评估与验收要点

先统一缺陷标准

这类项目应先明确缺陷定义和可接受范围,再按批次、材料和光照组织样本;小样本演示不能代替真实产线验证。

把现场节拍纳入验收

除了漏检与误检,还要检查图像、工件和分拣结果能否对应,以及延迟是否满足现场节拍。具体设备接口按现场确定。

年份
2025
行业
工业制造
方向
优化与能耗
状态
开发与交付

案例 07

电子设备制造参数优化与能耗管理

为电子设备制造场景完成工艺参数优化与能耗管理项目的开发和交付。

结合工艺数据与能耗数据进行参数优化,并对生产能耗进行管理。

业务难点

同一组工艺参数在不同原料、设备状态与产品规格下,质量和能耗表现可能不同。降低总用电量也未必代表效率提升,可能只是产量下降。

工艺参数与能耗管理参考流程
  1. 01

    数据对齐

    • 工艺参数
    • 质量与能耗记录

    按生产批次与时间关联

  2. 02

    关系建模

    • 制造数据分析
    • 参数与结果关系

    找出值得验证的影响因素

  3. 03

    优化建议

    • 约束内的候选搜索
    • 质量与设备边界

    形成可供评审的调整建议

  4. 04

    效果验证

    • 生产结果
    • 能耗跟踪

    核对质量与能耗的变化

参考实施方案;具体模型、设备和系统接口需按项目条件确定。

关键技术:解决什么,为什么有效

技术设计 01

批次对齐 + 质量与能耗联合分析

难点
工艺、质量和电表记录的粒度不同,错误关联会让模型学到生产结构变化而非参数作用。
技术路径
参考设计以批次和时间窗口关联参数、质量、产量与能耗,区分产品规格和运行状态;建立质量与单位产出能耗的预测关系,分析哪些参数值得进入现场试验。
作用与验证
将数据相关性变成可检验的调整假设,同时避免把不同产品、产量下的能耗直接横向比较。
技术设计 02

约束优化 + 小范围工艺验证

难点
模型给出的最低能耗参数可能损害质量,或超出设备与工艺许可范围。
技术路径
参考方案将允许参数范围、质量底线和设备约束显式纳入候选搜索;优先在已有数据支持的范围内提出建议,再由工艺人员评审并进行可比条件下的小范围验证。
作用与验证
把节能目标与质量、可制造性一起考虑;以实际生产反馈判断建议是否有效,再逐步扩大使用范围。

交付与成效

已完成电子设备制造参数优化与能耗管理项目的开发和交付。具体优化算法与节能比例未在现有资料中披露;上述为围绕项目目标的参考技术设计。

查看评估与验收要点

在工艺约束内优化

质量、安全和设备允许范围是参数调整的前提。参考方案先给出候选,再由现场人员评审与验证。

在可比条件下看收益

产品、产量或原料变化都会影响能耗。评估时需要统一比较条件,区分参数调整与生产结构变化带来的影响。

年份
2026
行业
工业制造
方向
大模型应用
状态
开发经验

案例 08

企业知识助手与工艺规范问答

积累 SOP、EHS、工艺规范问答,试验数据检索和知识助手等应用的开发经验。

面向规范文件和试验数据,提供自然语言问答与检索。

业务难点

企业规范包含版本、权限和专业术语,试验数据又有字段、单位和查询条件。只把文档交给大模型,容易引用过期依据或生成无法核对的答案。

企业知识问答参考架构
  1. 01

    知识准备

    • SOP/EHS/工艺规范
    • 版本与访问权限

    整理可检索的知识范围

  2. 02

    检索

    • 关键词 + 语义检索
    • 权限过滤/重排

    找到用户有权查看的依据

  3. 03

    回答生成

    • RAG:检索增强生成
    • 条款与版本引用

    依据检索内容组织回答

  4. 04

    核对与反馈

    • 来源定位
    • 缺失知识反馈

    便于核对并补充资料

参考实施方案;具体模型、设备和系统接口需按项目条件确定。

关键技术:解决什么,为什么有效

技术设计 01

RAG 检索增强:答案绑定原始依据

难点
术语精确匹配与自然语言相似度各有局限,检索到的片段还可能缺少适用条件。
技术路径
参考架构按章节和条款组织文档,保留版本与权限元数据;结合关键词、语义检索与重排筛选依据,再让大模型依据片段回答并标注来源。无充分证据时明确提示。
作用与验证
让用户能回到原文核对,降低脱离企业资料生成答案的风险,同时便于定位检索失败与资料缺失。
技术设计 02

问答与数据查询分路,权限贯穿检索

难点
规范解释与试验数据统计属于不同任务,混在一条生成链路中容易误用字段、单位或权限。
技术路径
参考设计先区分文档问题与结构化数据问题;后者将需求映射到受控查询,校验字段、单位、过滤条件及访问权限,再返回可追溯结果。权限在检索或查询执行时落实。
作用与验证
将模型用于理解问题与组织回答,把数据读取交给受约束的工具;用越权、过期文档、缺失答案等样例检查边界。

交付与成效

已积累 SOP、EHS、工艺规范问答、试验数据检索与知识助手开发经验。上述为参考架构,具体模型和检索组件按企业数据条件选择;不承诺未经验证的准确率。

查看评估与验收要点

文档问答与数据查询分开

规范问答需要保留文件版本和出处;试验数据查询需要明确字段、单位和过滤条件。两类数据用不同检索方式,再按问题组织结果。

有依据才回答

参考方案以权限控制、来源引用和无依据时明确提示为重点。验证集应覆盖找不到答案、过期文档及越权问题。

您的企业想解决什么问题?

简单描述需求,我们先评估是否可行。

提交企业需求 ↗