技术能力

从算法竞赛到企业系统,
多年积累的技术能力

我们把感知、认知、决策技术结合起来,接入企业的业务流程和现有系统。从数据准备、模型选择到部署验证,技术选择围绕业务问题展开。

1能力图谱

图 1技术能力图谱:感知 · 认知 · 决策 · 工程化
01

感知Perception

从图像、视频和传感数据中识别对象与状态。

  • 工业视觉质检缺陷识别、质检判定与分拣联动项目 · 2025 视觉质检与智能分拣
  • 人体关键点与姿态关键点检测、跨帧动力学修正项目 · 高尔夫 AI 教练系统
  • 医学影像病理图像分类竞赛 · Kaggle Mayo Clinic STRIP AI 冠军
  • 遥感与传感数据多站点气象与遥感数据融合项目 · 国家电网水电站预测
  • 3D 视觉、OCR 与视频理解点云、检测分割、文字识别专家网络
02

认知Cognition

理解文本、知识与多模态内容。

  • 大模型应用与场景适配垂直场景适配、部署效率与算力成本创始人 · 周知瑞
  • 知识助手与文档问答SOP、EHS、工艺规范问答与数据检索项目 · 2026 知识助手
  • 多模态表示与推荐视频、语音、文字与图关系融合平台 · 万象推荐
  • 自然语言处理信息抽取、文本理解创始人 · 叶琨豪;专家网络
03

决策Decision

预测趋势、评估风险并给出优化方案。

  • 时间序列预测DeepAR、Time-Transformer、GBDT 融合项目 · 国家电网水电站预测
  • 风控建模特征工程、评分卡与机器学习项目 · 招商银行催收模型
  • 参数优化与能耗管理制造工艺参数优化、能耗管理项目 · 2025 电子设备制造
  • 强化学习序列决策与策略优化创始人 · 叶琨豪;专家网络
  • 量化与金融建模量化交易、精算建模专家网络
04

工程化Engineering

让模型接入系统、稳定运行。

  • AutoML 平台自动特征工程、建模与模型选择平台 · 森罗 AutoML
  • 数据中台与数仓企业级数据中台、数仓架构、BI 分析创始人 · 赵晓民
  • 分布式计算与部署Spark、Hadoop、Kubernetes;模型导出与生产评分平台 · 森罗 AutoML
  • 结构化数据建模竞赛级特征工程与模型集成竞赛 · Kaggle Grandmaster/Master

依据:已交付项目、自研平台、Kaggle 竞赛成绩、创始人履历及专家网络公开资料。

2自研平台

2021 · 自动化机器学习

森罗 AutoML

面向非算法专业用户的自动化机器学习平台。用可视化界面完成数据接入、探索分析、特征工程、建模和模型选择;统一主流机器学习与深度学习算法接口,模型可导出到生产评分环境。

  • 全数据流可视化操作
  • 主流 ML/DL 算法统一接口
  • 集成数据预处理与特征工程
图 2森罗 AutoML 系统架构
数据源HDFSS3NFS本地文件SQL
分析语言与工具RPythonJSONJavaScalaTableauKNIME

森罗 AutoML

  1. 01数据加载分布式内存无损压缩
  2. 02探索与描述分析特征工程与选择
  3. 03监督与无监督建模模型评估与选择
  4. 04预测数据与模型存储
数据预处理导出 · POJO模型导出 · POJO/MOJO
生产评分环境SparkKafkaFlinkNiFiHive自定义环境
计算集群HadoopSparkKubernetes

依据布尔艺数现行官网架构图重绘。

2021 · 多模态推荐

万象推荐

基于计算机视觉、自然语言处理和图挖掘技术,整合视频、语音、文字、社区关系和操作历史的推荐算法平台。

  • 视频/语音/文字多模态支持
  • 召回与排序模型冷热互备
  • 海量数据预训练支持冷启动
图 3万象多模态推荐平台
多模态输入文字视频语音社区关系操作历史
表示学习计算机视觉自然语言处理图挖掘海量数据预训练,支持冷启动
推荐引擎召回模型排序模型召回与排序冷热互备
输出个性化推荐

依据布尔艺数现行官网示意图重绘。

3从模型到业务系统

模型效果与系统可用性需要分别验证。下面以一般企业算法项目为例,说明数据、模型和业务系统如何衔接。

模型构建与业务运行分开,结果反馈用于持续评估

构建与验证

  1. 01

    数据准备

    • SQL/文件接入
    • 字段与样本核对

    明确数据口径

  2. 02

    训练与比较

    • 特征工程
    • 候选模型与基线

    验证模型是否带来改善

  3. 03

    评估与选定

    • 离线回测
    • 错误样本分析

    确定适用范围

  4. 04

    形成制品

    • 模型与预处理
    • 版本与配置

    得到可复现的部署版本

模型与预处理版本 ↓ 业务结果与异常样本 ↑

业务运行

  1. 01

    业务输入

    • 批量任务/在线请求
    • 字段校验与权限

    只接收约定输入

  2. 02

    生产推理

    • 一致的预处理
    • 已验证的模型版本

    生成预测或推荐结果

  3. 03

    业务使用

    • 业务规则
    • 人工复核或执行

    将结果用于具体流程

  4. 04

    运行评估

    • 时延与失败率
    • 输入变化与业务效果

    判断是否需要调整模型

通用部署参考。批处理、实时服务及私有部署方式,按数据权限、业务时效和现有基础设施选定。

4研究方法如何应对真实问题

Kaggle · Mayo Clinic - STRIP AI · 2022

超高分辨率、少样本的医学影像分类

布尔艺数导师 KHY、KKY 组队获得该竞赛冠军。方案将超高分辨率图像切成图块,以预训练模型提取特征,再通过 Attention Pooling 汇总图块信息,并结合分组交叉验证与模型集成。

这个案例可以具体展示如何处理图像尺寸、有限样本和验证方式之间的关系。竞赛成绩与临床应用验证属于不同阶段。

查看当年的方案报道 ↗

您的场景需要哪些技术?

描述业务问题,我们先判断技术路线和数据条件。

提交企业需求 ↗

关联业务 · 教育与成长

同样的算法与项目经验,也用于培养 AI 人才

布尔艺数同时提供竞赛、科研和就业方向的辅导课程,由创始团队和导师根据学员课题匹配指导。