Data for AI能力介绍
背景信息
在企业级AI时代,随着推理模型和垂域模型能力的突破,AI正从开发者工具演变为企业核心生产力。然而,传统数据仓库面临三重挑战:多引擎架构带来的数据冗余与运维负担、AI与数据平台割裂导致的开发效率低下、非结构化数据的价值难以充分释放。企业不再仅仅需要“更快的查询引擎”,而是需要能够理解、推理并创造价值的“智能数据伙伴”。
如何解决这些挑战,实现数据价值的最大化?华为云DWS 9.1.1.200版本,提供Data for AI融合分析能力,集成MCP协议,支持一站式OLAP分析、点查、全文检索、库内推理和AI推理等融合分析能力,重塑企业智能应用开发新范式,便于数据工程师更便捷地使用AI,从而实现数据价值最大化,为企业客户提供更加实时、智能、高效的决策支持。
为什么企业需要AI原生数据仓库
在企业级数据分析场景中,传统融合分析架构依赖多个独立引擎协同工作,如Elasticsearch处理全文检索、Milvus负责向量检索、Doris专注OLAP分析、ClickHouse承载点查场景。然而该架构存在显著问题:
- 存储冗余:数据在各引擎间重复存储,导致资源利用率低下。
- 运维复杂:多系统独立维护,故障定位与性能调优困难。
- 开发低效:数据格式转换与链路适配消耗大量研发资源。
- 实时性不足:批量数据流转难以满足AI应用毫秒级响应需求。
如何解决这些问题,提高数据分析的效率和实时性?DWS提供AI原生的一站式分析引擎,极大地简化了原有多引擎协同分析架构。该引擎集成MCP协议,打通与大模型平台的交互通道;集成向量检索能力,内置AI Function支持大模型调用,实现端到端的库内推理,从而构筑AI-Ready数据分析基础设施,消除数据孤岛。同时,通过基于Binlog的物化视图实现流批一体增量计算能力,面向开发者提供声明式Pipeline加工新范式,实现近实时分析。整体架构更加轻量化,显著提高开发效率,降低运维管理难度,满足企业AI平台部署一站式多模态融合分析的核心诉求。
Data for AI四大核心能力
Data for AI包括以下核心能力:
MCP协议原生集成:打通AI生态的“神经网络”
MCP(Model Context Protocol,模型上下文协议) 是由 Anthropic 推出的一种开放标准,即“AI的USB-C”,旨在统一大模型与外部数据源、工具之间的通信协议,从而解决当前 AI 模型因数据孤岛限制而无法充分发挥潜力的难题,MCP 使得 AI 应用能够安全地访问和操作本地及远程数据,为 AI 应用提供了连接万物的接口。
DWS支持对接MCP协议,一键式可配置,即插即用。通过标准化协议接口,企业可无缝接入Claude、Cursor等主流AI平台,内置8个常用的数据分析与运维监控类型API,真正实现“万物互联,开箱即用”。
AI Function:可插拔式的库内AI推理
DWS集成开源社区插件pgai,支持对接外部开源大模型、华为云MaaS服务等,通过库内SQL方式调用大模型进行推理,提供文本分析(ai.classify)、向量化(ai.embed)、文本摘要(ai.summarize)以及情感分析(ai.sentiment)等24个AI Function,将大模型推理能力下沉至数据库内核,从而为企业客户提供更加智能化的数据分析服务,实现数据即推理、即处理的全新操作模式,助力企业快速获取洞察,提升决策质量和效率。
向量计算:非结构化分析的“水电煤”
企业 80% 的数据为文档、图像、音视频等非结构化数据。这类数据过去长期处于数据挖掘盲区,数据价值一直被低估;依托多模态统一向量存储与表征技术,多模态检索不再存在技术门槛。
DWS深度集成开源社区插件pgvector,实现分布式架构的改造,支持向量数据类型,支持IVFFlat、HNSW索引结构,支持相似度计算、最近邻搜索等多种高阶算法,实现基本的向量检索能力。
内置大模型特征算子:赋予用户AI分析“无限创造力”
通过PL/Python扩展支持,内置32个自研扁鹊大模型算子,将Python数据科学生态完整引入SQL工作流。开发者可直接在库内运行复杂AI算法,消除跨系统数据流转开销,实现从特征工程到模型推理的端到端闭环。
DWS AI数仓使用场景
场景1. 零售行业:实时运营、智能选品及精准营销三位一体,提升消费者体验
- 客户痛点
- 业务价值创造
- 在线报表:支持年、月、周、日度报表的高效生成,统计商品类目信息及销量情况等,助力客户日常经营决策。
- 实时运营:对接直播销售渠道,实时采集商品评价中负向情感占比超过30%的数据,自动触发预警机制,运营人员及时调整话术或发放优惠券。
- 智能选品:结合“销量数据+评价情感+相似商品热度”,精准筛选高潜商品,为采购决策提供科学指导。
- 精准营销:基于用户画像,向具有高复购特征且评价中提及“送礼”的用户,推送礼盒装商品优惠券。
场景2. 制造行业:以设备-工艺-质量联动,助力实时决策与品质提升
- 客户痛点
- 设备IoT数据、工艺参数表、质检报告分别存储于不同系统(IoT平台、ERP、MES),导致跨系统分析时存在冗余数据同步问题。
- 质量缺陷分析依赖人工经验,难以快速定位“设备参数异常-工艺偏差-缺陷产生”等关联关系。
- 离线分析无法支撑实时工艺调整。例如,某台设备振动值超标时,无法即时预警以避免批量次品的产生。
- 业务价值创造:
- 流批一体:IoT设备数据实时入库,并定期执行批量增删改操作。离线计算历史工艺参数与缺陷率的关联规则,实时监控IoT数据,当参数偏离最优区间时触发预警。
- 质量溯源:输入某批次次品编号,一键查询“生产设备IoT数据+工艺参数+质检记录”,快速定位缺陷根因。
- 预测性维护:基于设备传感器数据和历史故障记录,预测设备故障概率,提前安排维保,减少停机时间。
- 工艺优化:通过SQL统计分析不同工艺参数组合的合格率,利用回归算法建模“温度-压力-合格率”的关系,输出最优工艺参数区间,将产品合格率提升5%-10%。
场景3. 金融行业:交易-行为-舆情联动,构筑金融风控实时决策新防线
- 客户痛点
- 传统风控仅依赖交易数据(如金额、时间、商户),难以识别异常行为与舆情风险。例如,即使账户被盗,交易金额可能保持正常,但登录设备出现异常。
- 规则引擎也难以应对新型欺诈手段,如“羊毛党”通过批量注册账号、模拟正常行为进行薅羊毛。
- 舆情风险(例如某企业被曝财务造假)无法实时同步至风控体系,导致信贷决策滞后。
- 业务价值创造
- 实时风控:交易发生时,实时完成多维度风险评估(包括账户异常、设备异常等),拦截盗刷、羊毛党等欺诈行为,降低损失率。
- 实时反欺诈:实时筛选分析“单笔交易大于5万+月交易次数骤增10倍”的用户,通过向量检索匹配用户行为与欺诈样本的相似度。
- 信贷智能决策:向企业发放贷款前,结合“财务数据+舆情风险+行业趋势”等信息,输出信贷额度和利率建议。
- 舆情风险预警:当企业被曝出负面新闻时,自动标记相关信贷客户,启动风险排查流程。