微信分享
DACon 2026 · 北京站

使用微信扫一扫分享到朋友圈

活动分享
DACon 2026 · 北京站

使用微信扫一扫进入小程序分享活动

活动介绍

1111451123617065.png


2 天沉浸式学习交流 | 15+前沿分论坛 | 60+真实应用案例


过去两年,企业 AI 经历了从"模型狂热"到"理性落地"的明显转向。


行业关注点已不再停留在"有没有接入大模型",而是在追问:企业是否准备好了承载 AI 的整套基础结构——是否具备 Agent-Ready 的数据底座、清晰的语义体系、完整的治理能力、可持续的评测闭环和系统化的工程能力;是否能把模型能力真正做成系统能力,并最终转化为组织效率与业务价值。


同时,从近期产业趋势看,企业 AI 正在从单点 Copilot 走向 Agentic、Multi-Agent、可观测、可治理的系统形态;“模型选择"正在演变为"模型组合与路由”;语义层与上下文工程正在被国际技术圈共同认定为 2026 的关键基础设施;Agentic RAG 正在替代传统单次召回的 RAG 范式。


北京站正适合把这些已经进入企业实践门槛区、但尚未被充分系统化讨论的话题集中展开。围绕这一判断,本届大会将聚焦四个根本性转向:

● 从模型驱动走向数据与语义驱动;

● 从接入模型走向承载语义与上下文;

● 从单一模型选择走向模型能力的组合与编排;

● 从单点 AI 应用走向系统化的价值兑现。


这,就是本届 DACon 北京站的核心理念:Data-First, AI-Real——回到数据本位,让 AI 真正跑在企业之上、跑进业务之中、跑成可衡量的价值。


专家团
  • 阿里云EMR负责人,资深技术专家李钰
    李钰
    阿里云EMR负责人,资深技术专家

    阿里云EMR研发团队负责人,资深技术专家,Apache Flink & HBase PMC Member,Apache软件基金会Member。

  • 阿里云 AI搜索研发负责人邢少敏
    邢少敏
    阿里云 AI搜索研发负责人

    阿里云AI搜索研发负责人,负责阿里云AI搜索产品OpenSearch、阿里云ElasticSearch AI研发,以及开源搜索引擎Havenask研发。覆盖AI搜索、向量检索、大数据检索、对话式搜索等多个场景。带领团队研发多款搜索、推荐和智能问答类产品研发。目前主要聚焦在大模型AI搜索研发,关注大模型AI搜索对业务和客户的价值。

  • 上海银行 数据管理与应用部总经理于浩瀚
    于浩瀚
    上海银行 数据管理与应用部总经理
  • 江苏润和软件股份有限公司 首席AI科学家 &人工智能事业部总经理徐立扬
    徐立扬
    江苏润和软件股份有限公司 首席AI科学家 &人工智能事业部总经理

    现任润和集团首席AI科学家和人工智能事业部总经理,曾任京东科技海外金融创新供金负责人、京东智能城市研究院资深研究员,并入选京东TGT顶尖技术天才(天才少年)项目。长期深耕Agentic AI、RAG、Web3、风险建模与多智能体系统,主导多项AI Agent及金融科技项目从0到1落地。发表SCI论文10余篇、专利5项以上,入选北京市优秀人才计划。

  • 首席架构师李丰
    李丰
    度小满 首席架构师

    多年 IT、互联网工作经验,在基础平台架构与研发、金融分布式系统、金融科技探索与应用方面有丰富经验。负责度小满整体技术的规划与推进,以及信贷技术架构从1.0到4.0的演进,支持了业务多年数倍的持续增长。
    在金融科技探索上,主导了区块链、复杂工程技术、虚拟现实、物联网技术、LLM的探索与应用落地;从0组建了百度第1个区块链研发团队,相关工作荣获了福布斯全球、哈佛商业评论、工信部等国内国际荣誉。推动与参与了多项国内国际标准的制定,以及白皮书、蓝皮书的攥写,个人累计申请了60多项国际、国内发明专利。

  • 副总裁胡云华
    胡云华
    智谱华章 副总裁

    胡云华,西安交通大学和微软亚洲研究院联合培养博士,先后担任微软亚洲研究院副研究员、阿里巴巴达摩院资深算法专家、支付宝中国首席数据官、智谱华章副总裁,在搜索、广告、推荐、大模型研发、用户产品创新方面拥有丰富经验。

  • 数势科技   CTO韩秀锋
    韩秀锋
    数势科技 CTO

    13年+百度产品和研发管理经验,原百度地图场景化业务总经理,具备出色的产品、技术团队管理能力和技术实操经验。

  • 研发总监单超
    单超
    ebay 研发总监

    具有多年在传统数据库管理和大数据分布式平台开发与维护的专业背景。熟练掌握大数据技术,能够高效地进行批处理和流处理任务的设计和实施。对数据湖架构的构建和优化也有深入研究,能够帮助企业从海量数据中提取有价值的信息,支持数据驱动的决策制定。
    目前在eBay作为数据平台研发总监,带领团队负责云原生的数据湖,分布式搜索引擎,调度系统,存算分离计算引擎,OLAP离线数据库,数据开发平台等技术的实施,优化,开发工作。

  • 京东零售 平台产品与研发中心 数据库运维团队负责人涂勇
    涂勇
    京东零售 平台产品与研发中心 数据库运维团队负责人

    现就职于京东零售。之前担任平安壹钱包大数据部门副总经理,带领团队致力于构建高效的数据分析体系,通过创新技术推动业务增长与客户体验优化,主导了多个关键项目,包括企业级数据平台的搭建与升级、智能数据分析工具的研发等,显著提升了公司内部决策效率。专注于深度学习、自然语言处理等领域的大规模机器学习模型开发。并积极推动研究成果向实际场景转化,特别是在数据管理、风险控制等方面取得了突破。

  • 美的集团 首席信息安全官兼软件工程院院长,欧洲科学院院士,IEEE Fellow刘向阳 院士
    刘向阳 院士
    美的集团 首席信息安全官兼软件工程院院长,欧洲科学院院士,IEEE Fellow

    美的集团首席信息安全官兼软件工程院院长,欧洲科学院院士,IEEE Fellow IET Fellow ACM Distinguished Scientist。

  • 人工智能业务部高级总监吴友政
    吴友政
    京东科技 人工智能业务部高级总监

    吴友政博士,京东科技集团语音语义算法部负责人、高级总监。博士毕业于中国科学院自动化研究所,毕业后在日本情报通信研究机构、英国爱丁堡大学、索尼中国研究院和爱奇艺负责自然语言处理、语音识别、机器翻译等前沿技术研究和产品研发工作,在国际自然语言处理顶会和期刊(如ACL、NAACL、EMNLP、AAAI、ICASSP等)上发表多篇学术论文。曾获得语音识别(IWSLT2012、IWSLT2013)和对话式机器阅读理解(QuAC 2020)比赛的冠军。连续2年主办京东人机对话挑战赛。技术产品化上,带领团队打造了基于多轮对话技术的智能客服平台言犀、基于多模态内容生成技术的品创等产品。曾获得京东集团技术金牛奖等荣誉。

  • 数据平台产研负责人王涛
    王涛
    滴滴出行 数据平台产研负责人

    王涛,滴滴数据平台产研负责人,2018 年加入滴滴,专注于构建智能、易用、安全的数据产品矩阵,并推动 AI 技术在数据平台的深度融合。曾在阿里巴巴集团担任工程技术关键岗 8 年。技术面覆盖大数据、人工智能、泛前端等多个领域。

  • AI科技事业部总经理张凯
    张凯
    蚂蚁数科 AI科技事业部总经理

    AI数据生产(标注、数据集、合成)、AI安全(评测、防御)、AI软硬件一体、AI营销相关领域从业者。

  • 首席企业架构师武艳军
    武艳军
    一汽-大众汽车有限公司 首席企业架构师

    企业架构和数字化转型专家,北京大学理学硕士,银行、保险、车企20年工作经验,《企业架构驱动数字化转型》作者,“金融IT那些事儿”公众号主理人。

  • 技术副总经理、AIGC负责人陈炜于
    陈炜于
    阅文集团 技术副总经理、AIGC负责人

    阅文集团技术副总经理,AIGC负责人,腾讯云最具价值专家、复旦大学计算机学院专业硕士导师。有着近15年的人工智能、大数据研发管理经验。在AIGC、个性化推荐、搜索、大数据挖掘、自然语言处理等领域都有丰富的实践经验。目前主导人工智能技术在集团内部的研发和应用落地,带领团队研发了阅文妙笔大模型和多模态大模型,并在作家辅助创作、角色对话、增长素材和机器翻译等大模型应用场景上也取得了不错的成果。对内容业务有深刻理解,也主导推进智能风控、推荐系统、反盗版等公司重点项目落地。曾任百度人工智能事业部技术经理,负责过百度推荐、精准广告、图片搜索、大数据商业化等项目。

  • 大会专题


    AI Ready到Agent Ready:Data+AI平台架构升级

                    企业语义层建设

    Data Engineering Agent:数据工程智能

    • 面向 Agent 的数据接口与服务化设计

    • 实时数据、历史数据与知识数据的一体化供给

    • Agent 消费模式下的权限控制、审计与限流

    • 数据平台如何从 BI 底座演进为 Agent 底座

    • 企业在湖仓、实时平台、服务层上的升级路径

    • 企业语义层、本体建模与知识组织方法

    • 语义层四大支柱:开放、治理、多模型、可组合

    • 语义层在 BI、AI、Agent 三场景的统一服务

    • 语义对象的代码化管理:YAML、Git、版本控制

    • 语义层防止指标漂移与语义漂移的实践

    • LLM驱动元数据补全与语义化

    • 数据质量、血缘、异常的自动识别

    • SQl、ETL、调度配置的智能生成与优化

    • 数据开发、测试、运维、治理的智能化

    • Pipeline质量守护与DataOps集成


    Agentic Workflow:数字员工与企业流程重构企业模型组合:选型、路由、成本与治理模型适配与效果优化:从 Harness 到后训练
    • 从 Copilot 到 Agentic Workflow:企业流程智能的最新演进

    • 数字员工在客服、审批、运营、协同、服务台等场景中的实践

    • Agent 如何与工作流、RPA、规则引擎、企业系统集成

    • 多角色协同、人工兜底与流程治理机制

    • 流程自动化的效果评估、风险控制与规模化推广路径

    • 模型组合与路由策略:大模型、小模型、专用模型如何协同

    • API、私有化、托管式模型服务与 MAS 平台的组合方式

    • 成本、时延、风险、治理目标之间的平衡

    • 企业如何建设统一的模型接入与治理层

    • 典型任务下的模型 ROI 选择方法

    • Harness Engineering:用 Agent 框架与评测反馈循环保证输出效果

    • SFT+DPO 落地:低成本后训练 pipeline、偏好数据构造与效果评测

    • GRPO/RLVR 推理增强:规则奖励设计、在线 RL 训练与效果验证

    • Agent 后训练:工具调用对齐→执行偏好→推理增强三阶段实践


    非结构化数据处理与知识获取上下文工程:让 AI 真正懂企业

    企业本体与知识工程

    • 文档解析深水区:复杂表格/跨页/嵌套版式的高精度解析,为什么表格是"最后的前沿"

    • 多模态内容理解:图文混排的联合理解,文本与图像信息的融合对齐

    • 解析质量评估:处理结果准确率怎么测、怎么持续提升

    • 行业场景实践:金融文档智能、制造图纸/质检、医疗病历/影像的处理落地

    • 从 RAG 到 Context Engineering 的范式演进

    • Schema 强制、结构化系统提示、元数据注入

    • 长上下文 vs 检索:百万 token 时代如何选择

    • 短期、长期、向量记忆机制的工程设计

    •  Agent、RAG、工作流场景中的上下文工程实践

    • 上下文工程的成本、延迟与可观测性

    • 企业本体建模方法与知识图谱实践

    • 知识、规则、流程的形式化表达

    • 知识工程与大模型、Agent 的结合方式

    • 金融、制造、政务、医疗复杂场景的本体实践

    • 从静态本体到动态本体:支持模拟、推演与决策


    生成式推荐系统新范式

    Agent 评测工程:从度量到改进的闭环

    AI 驱动的客户全旅程:从营销获客到客服服务

    • 生成式推荐的核心范式与架构变化

    • 大模型在召回、排序、特征生成中的应用

    • 多模态、多场景、多目标推荐的新方法

    • 推荐与对话、搜索、内容生产的融合

    • 评测集建设:线上真实问题驱动,构造方法与滚动更新

    • 评分框架:多维评分体系与细粒度判定方法

    • 评测自动化:无人值守流水线与上线门禁

    • 度量与改进:指标归因与坏例回流闭环

    • 垂类评测挑战:开放任务完成判定与业务判据工程化

    • AI 驱动的广告、投放与营销自动化

    • AIGC 内容生产与品牌内容工业化

    • 精细化用户运营、用户分层与生命周期管理

    • 对话式 Agent 在售前、售后、运营中的应用

    • 多渠道、多语种、多模态的客户交互


    AI 时代的研发范式与组织进化决策智能 Agent:从数据洞察到经营动作

    金融可信 AI 实践

    • 代码审核重构:AI 审 AI、规则审 AI、人审关键路径

    • 人机协作工作流:工程师角色与能力升级

    • 研发效能的重新度量:从产出到业务结果

    • 组织结构进化:扁平化、平台化、双轨化

    • 数据、算法、AI 产品、业务的边界重构

    • 管理层视角下的组织转型路径

    • 决策智能 Agent 的最新范式:从数据问答到洞察生成

    • 指标解读、异常归因、趋势分析与经营诊断

    • 分析型 Agent 如何结合业务语境、规则与知识体系

    • 从洞察到建议:决策支持如何进入经营流程

    • 金融智能风控、合规审查、投研与客服中的 AI 实践

    • 政务流程辅助、公文处理、智能问答与公共服务优化

    • 高责任行业中的权限、安全、人工兜底与可追溯设计

    • 可信 AI 的效果评价和组织落地机制

    • 从试点到规模化上线的行业经验

    论坛出品人
  • 小米 数据中台负责人勇幸
    勇幸
    小米 数据中台负责人

    2013 年毕业加入小米,目前负责元数据管理与消息中间件两个方向,主要履历:
    1)核心参与并见证小米数据流平台从0到1、到成为公司数据收集与分发的事实标准,数据规模突破十万亿条/天
    2)主导并落地小米消息中间件选型方法论,推动 Talos 与 RocketMQ 双引擎的发展与建设
    3)负责小米数据管理平台的建设与应用落地,包括全域元数据、全域数据血缘、成本管理、质量监控等

  • 京东集团 算法总监周默
    周默
    京东集团 算法总监

    京东零售平台营销中心用户运营部算法总监,京东集团11年工作经历,历任京东商城技术中台基础算法部负责人、京东零售用户增长与运营部技术团队负责人、京东零售产研中心技术架构部算法总监,现任京东零售营销中心用户运营部首席架构师,拥有丰富的高可用工程架构以及算法驱动业务应用落地的实战经验,曾获北京市亦城优秀人才、京东集团优秀人才、京东集团算法大牛、最美京东人、京东零售十大最具影响力专家等称号。目前清华MBA在读,担任清华经管产业创新俱乐部主席,对AI时代下的技术战略布局及团队管理有独到见解。

  • 新浪微博 高级总监李庆丰
    李庆丰
    新浪微博 高级总监

    负责新浪微博基础架构和流媒体等研发方向。在高可用架构、视频、直播等技术方向有丰富的研发实战及管理经验。同时作为微博技术新兵训练营负责人,主导技术新人技术融入提升培训体系。

  • 阿里控股企业智能事业部数字员工负责人董晓庆
    董晓庆
    阿里控股企业智能事业部数字员工负责人

    董晓庆(花名萧庆)高级技术专家,加入阿里巴巴15 年,参与或主导过多个阿里及蚂蚁的顶级开源项目,自2020 年开始专注于阿里巴巴办公产品的研发和架构设计,负责过多款内部高频AI 应用产品,目前是集团数字员工的负责人,构建了数字员工的申请、开通、培训、评测和上岗的全流程,已经有数百个数字员工进入实际应用。

  • Datastrato CTO邵赛赛
    邵赛赛
    Datastrato CTO

    Datastrato 的联合创始人兼CTO,在大数据开源领域深耕十余年。Apache 软件基金会成员(Apache Member),Apache Spark 的 Committer 及 PMC(项目管理委员会)成员,并且是 Apache Gravitino 的原作者

  • Shopee 大模型工程负责人李超
    李超
    Shopee 大模型工程负责人

    先后在百度、Bigo、Shopee 工作,拥有 10 余年 AI Infra 经验,专注大规模 AI 系统架构与性能优化,在模型训练、推理加速及端到端工程体系方面积累深厚。当前在 Shopee 负责大模型预训练、后训练和推理基础设施建设,参与大规模 GPU 集群架构设计与性能优化,持续提升资源利用率与系统稳定性,推动大模型在公司内的高效迭代与规模化落地。

  • 京东集团 算法总监韩艾 博士
    韩艾 博士
    京东集团 算法总监

    中国科学院与美国康奈尔大学联合培养博士,北京大学双学士。现任京东集团算法总监,京东零售数据与算法通道委员,CCF 大赛专家委员会专家、京东赛题全球发布人。兼任中国科学院大学硕士企业导师、北京工业大学硕士企业导师、西安电子科技大学客座教授。在国际顶级期刊发表学术论文数十篇。专注AI技术创新,主持设计了 Multi-Agent Planning 算法架构并落地京东商家智能助手,擅长多 Agent 动态规划与协同训练、LLM 微调与强化学习。

  • 《老刘说NLP》 技术社区主理人刘焕勇
    刘焕勇
    《老刘说NLP》 技术社区主理人

    个人介绍:

    “老刘说NLP”公众号作者,曾就职于中国科学院软件研究所。主要研究方向为大模型数据挖掘与自动化评估、领域知识/事件图谱的构建与落地应用,主持或参与研制全行业事理图谱、百科图谱、知识图谱平台、事件情报分析、右侧推荐、大模型研发等落地项目,申请发明专利十余项、论文数篇。近年来在OGB-Wikikg2、CCKS多模态实体对齐、可解释类案匹配等评测中获得多项冠亚军。致力于自然语言处理技术开源共享,在github开源项目60+,收获star数超2W+。


  • 江苏润和软件股份有限公司 首席AI科学家 &人工智能事业部总经理徐立扬
    徐立扬
    江苏润和软件股份有限公司 首席AI科学家 &人工智能事业部总经理

    现任润和集团首席AI科学家和人工智能事业部总经理,曾任京东科技海外金融创新供金负责人、京东智能城市研究院资深研究员,并入选京东TGT顶尖技术天才(天才少年)项目。长期深耕Agentic AI、RAG、Web3、风险建模与多智能体系统,主导多项AI Agent及金融科技项目从0到1落地。发表SCI论文10余篇、专利5项以上,入选北京市优秀人才计划。

  • 蚂蚁集团   资深数据技术专家、蚂蚁消费信贷数据负责人崔伟斌
    崔伟斌
    蚂蚁集团 资深数据技术专家、蚂蚁消费信贷数据负责人

    现任蚂蚁集团资深数据技术专家,长期深耕消费金融、数据架构与数据智能领域。近年来重点探索大模型与数据技术的深度融合,围绕数据智能体、业务本体、智能分析与数据工程智能化开展实践,推动数据能力从传统的数据生产与分析,向“AI理解业务、智能体自主完成数据任务”演进。曾获多项国家专利,并受邀进行多次技术分享。

  • 数新智能   CEO陈廷梁
    陈廷梁
    数新智能 CEO

    数新智能创始人兼CEO,中国计算机学会大数据专委会执委、数据治理与发展技术委员会执委员,哈工大计算学部浙江校友会会长。
    原阿里云研发总监,阿里大数据平台DataWorks创始人和人工智能平台PAI的工程开发负责人。
    2020年创立数新智能,核心定位做全球领先的一站式多云AI原生数据智能平台,做大模型时代大数据 + 人工智能一体化底座平台。国际化方向支持跨国多云多引擎多中心,国内支持信创和国产替代。

  • 小赢科技 模型应用开发负责人武文斌
    武文斌
    小赢科技 模型应用开发负责人

    小嬴科技AI应用研发负责人,负责公司多款AI应用落地,覆盖营销、客服、资金、贷后等多个业务场景。带领团队完成多款检索、推荐、辅助、质检和智能问答类产品的研发。目前主要聚焦在垂直领域对话机器人方向的研发工作。

  • 小红书 搜索广告算法负责人王鹤达
    王鹤达
    小红书 搜索广告算法负责人

    小红书广告搜索算法团队负责人,此前为小红书社区算法团队核心成员。

    广告搜索算法团队是商业化最核心的技术团队之一,掌握着亿级商业预算分配,负责小红书的搜索变现——让合适的品牌出现在合适的位置。

    现在行业正从"关键词匹配"往"Agentic 意图匹配"转型,我们团队正在用 LLM + Agent 重构广告分发逻辑,也在同步构建端到端生成式广告的新产品。


  • ThinkingAI    Agent 首席架构师王浩强
    王浩强
    ThinkingAI Agent 首席架构师

    专注企业级 AI Agent 的技术架构与落地应用,推动数据分析、多 Agent 协作与业务执行融合,让数据洞察转化为可衡量的业务价值。

  • 专题演讲嘉宾
  • 云器科技  联合创始人&CTO关涛
    关涛
    云器科技 联合创始人&CTO

    2006年,微软亚洲研究院,构建微软第一代分布式KV系统SearchRepository (7000台物理服务器规模)和 Bing搜索的分布式存储后台Kirin Store(4万台规模)。之后加入微软美国云计算和企业事业部,主持和参与开发了包括 Cosmos/Scope(20万台规模),iScope, Azure Datalake


    2016年回国加入阿里云,前阿里云 计算平台事业部 研究员,阿里巴巴通用计算平台负责人,负责阿里巴巴主线大数据平台(飞天MaxCompute,Dataworks,10万+规模)。前阿里和蚂蚁集团技术委员会计算平台领域组长、阿里云架构组大数据组组长。2021年,代表阿里云主持Forrester 云数仓评测,并首次入选全球榜单“卓越表现者象限”。

    2021年,创立云器科技(“基于增量的云湖仓”数据基础设施提供商,yunqi.tech),担任CTO

    17年分布式系统和大数据平台开发经验,并著有多篇国内外会议论文和专利。2018浙江省科技进步一等奖,2021 USENIX ATC best paper award    

  • 瓴岳信息(洋钱罐)数据平台数据应用负责人郭志浩
    郭志浩
    瓴岳信息(洋钱罐)数据平台数据应用负责人

    长期深耕数据平台与 AI 基础设施方向,当前主导金融场景下数据应用平台的 Agent 化架构设计与演进,负责探索分析、归因分析、数据洞察、SQL 生成等场景 Agent 及底层 Skill 体系、标签系统的规划与落地。关注 LLM 与数据平台融合中的能力抽象、分层架构与工程化取舍。

  • 京东集团 算法总监周默
    周默
    京东集团 算法总监

    京东零售平台营销中心用户运营部算法总监,京东集团11年工作经历,历任京东商城技术中台基础算法部负责人、京东零售用户增长与运营部技术团队负责人、京东零售产研中心技术架构部算法总监,现任京东零售营销中心用户运营部首席架构师,拥有丰富的高可用工程架构以及算法驱动业务应用落地的实战经验,曾获北京市亦城优秀人才、京东集团优秀人才、京东集团算法大牛、最美京东人、京东零售十大最具影响力专家等称号。目前清华MBA在读,担任清华经管产业创新俱乐部主席,对AI时代下的技术战略布局及团队管理有独到见解。

  • 奇虎360科技 数据开发专家郭朝阳
    郭朝阳
    奇虎360科技 数据开发专家

    长期深耕大数据平台建设与BI分析方向,目前主要负责360智汇云湖仓数据应用平台的架构设计与核心研发,同时也是湖仓 Data Agent 化演进的技术负责人。工作重心围绕一条主线展开——如何让大模型的语义理解能力真正"落进"数据平台:从 NL2SQL 的准确率保障,到语义层的渐进式构建,再到分层架构下的工程化落地。持续关注 LLM 与湖仓能力的结合点,尤其是如何在确定性编译引擎与模型推理之间找到正确的分层边界,让数据智能从"能用"走到"敢用"。

  • 数据仓库负责人苗治勇
    苗治勇
    懂车帝 数据仓库负责人

    目前在懂车帝担任数据仓库负责人,之前在百度等公司有多年互联网工作经验

  • 小米高级算法工程师方彪
    方彪
    小米高级算法工程师

    现任小米高级算法工程师,长期深耕 Data+AI 领域。主导落地用户画像、智能分析、数据问答、Data Agent 等数据智能方案,2026 年 5 月 Bird 总榜第三。

  • 北京大学 DCAI 实验室研究助理 &元枢智汇联合创始人强美伊
    强美伊
    北京大学 DCAI 实验室研究助理 &元枢智汇联合创始人

    OpenDCAI 系列开源项目核心技术开发者,重点参与 AI 数据准备系统 DataFlow(GitHub 7.2K stars)与动态训练系统 DataFlex (GitHub 1.9K stars)的研发与落地,研究方向涵盖 Data-Centric AI、数据—模型协同训练与动态数据优化等。OpenDCAI开源生态累计获得GitHub万余颗Star,个人累计发表CCF-A类期刊及会议论文 7 篇,曾获国家奖学金及第十五届“尖烽时刻”商业模拟大赛全国总冠军等荣誉。现作为元枢智汇联合创始人,负责AI数据基础设施的技术产品化、解决方案设计与商业落地,推动 DataFlow、DataFlex 等技术从开源研发走向工程交付与行业应用。

  • LMCache(PyTorch Ecosystem) 维护者 & 核心架构师毛宝龙
    毛宝龙
    LMCache(PyTorch Ecosystem) 维护者 & 核心架构师

    毛宝龙(GitHub ID:maobaolong)是 PyTorch 基金会旗下开源大模型推理 KV 缓存管理层项目 LMCache 的维护者与核心架构师。他累计合并提交 200 余项代码合并请求,为项目第二大贡献者;其工作覆盖跨进程通用引擎服务、零拷贝 KV 数据传输、可插拔二级存储连接器框架、可观测体系以及多硬件厂商兼容适配等核心模块。他致力于打造不绑定特定硬件厂商的中立底层基础设施,并积极引导开源新人完成首次代码提交。

    他曾任职于多家头部互联网企业,包括腾讯、阿里云、京东,深耕 AI 基础设施、大数据存储与分布式缓存领域。

    此外,他也是 vLLM 项目的 Contributor,Alluxio 项目 PMC(项目管理委员会)成员 & Maintainer,同时担任 Apache Ozone 与 Apache Uniffle 的 Committer。他对开源事业抱有极大热忱,长期致力于扩大开源社区影响力,吸引更多开发者参与、落地与使用相关开源项目。

  • LMCache(PyTorch Ecosystem) 维护者 & 核心架构师郑春晓
    郑春晓
    LMCache(PyTorch Ecosystem) 维护者 & 核心架构师

    PyTorch 基金会开源项目 LMCache 核心维护者。LMCache 是服务于大模型推理的开源 KV 缓存管理层,chunxiaozheng累计提交 100+PR,为项目前五贡献者,主导完成 MLA 适配、DSA 支持、IO 流程优化、CLI 工具实现等关键功能开发。

  • 小红书 搜索广告算法负责人王鹤达
    王鹤达
    小红书 搜索广告算法负责人

    小红书广告搜索算法团队负责人,此前为小红书社区算法团队核心成员。

    广告搜索算法团队是商业化最核心的技术团队之一,掌握着亿级商业预算分配,负责小红书的搜索变现——让合适的品牌出现在合适的位置。

    现在行业正从"关键词匹配"往"Agentic 意图匹配"转型,我们团队正在用 LLM + Agent 重构广告分发逻辑,也在同步构建端到端生成式广告的新产品。


  • 中国人民大学 助理教授张绍磊 博士
    张绍磊 博士
    中国人民大学 助理教授

    于中国科学院计算技术研究所获得博士学位。他的研究方向涵盖大语言模型、多模态大模型、AI for Data Science。相关研究成果在 NeurIPS、ACL、ICLR 等国际人工智能与自然语言处理会议发表论文30余篇,开源的多语言大模型、多模态大模型、数据科学大模型在 GitHub 社区累计获得7000+星标。他长期担任 CCF-A 类国际会议 ACL ARR 的领域主席和责任编辑。个人主页:zhangshaolei1998@github.io。

  • 中兴  研发改进负责人路芳芳
    路芳芳
    中兴 研发改进负责人

    部门改进负责人,负责推进AI提效策略在项目的落地,辅助项目达成效能提升目标

  • 小赢科技 模型应用开发负责人武文斌
    武文斌
    小赢科技 模型应用开发负责人

    小嬴科技AI应用研发负责人,负责公司多款AI应用落地,覆盖营销、客服、资金、贷后等多个业务场景。带领团队完成多款检索、推荐、辅助、质检和智能问答类产品的研发。目前主要聚焦在垂直领域对话机器人方向的研发工作。

  • Airwallex 空中云汇 架构师董大凡
    董大凡
    Airwallex 空中云汇 架构师

    董大凡,南开大学计算机应用技术博士,大数据、云原生与企业级 AI 系统专家。曾任职于雅虎、微软、亚马逊等头部科技公司,现就职于 Airwallex Risk Team。近年来专注于 AI 在金融风控与合规领域的工程化落地,主导 Airwallex 首个 AI 风控产品从 0 到 1 建设并投入实际业务,持续推动多  Agent 与跨 Case 智能协同在风控系统中的应用。

  • 杭州群核信息技术有限公司 SRE团队负责人、软件开发专家何碧宏
    何碧宏
    杭州群核信息技术有限公司 SRE团队负责人、软件开发专家

    何碧宏,目前为群核科技SRE团队负责人、软件开发专家、稳定性委员会核心成员,此前担任过监控、可观测及应用团队负责人,有丰富的系统稳定性保障、AIOps实战经验,主导根因分析、故障自愈、故障演练、AIOps等SRE平台建设,企业故障数从三位数降到个位数的亲历者。此前在诺基亚工作十余年,参与过诺基亚 DevOps 平台、网管系统的架构和建设。

  • 新浪微博 高级总监李庆丰
    李庆丰
    新浪微博 高级总监

    负责新浪微博基础架构和流媒体等研发方向。在高可用架构、视频、直播等技术方向有丰富的研发实战及管理经验。同时作为微博技术新兵训练营负责人,主导技术新人技术融入提升培训体系。

  • 快手 数平产品技术中心负责人张蕤
    张蕤
    快手 数平产品技术中心负责人

    快手数平产品技术中心负责人,10多年大数据平台系统建设经验,当前专注于 Data Agent、大数据分析与服务平台、大数据开发与治理平台、资产服务平台等大数据中台建设工作

  • 知乎社区运营研发&平台产品负责人侯容
    侯容
    知乎社区运营研发&平台产品负责人

    致力于通过平台化、产品化与智能化手段,完成对企业级业务的数字化与智能化转型。专注于运营、活动、安全、氛围、治理、反作弊及客服等领域,带领团队完成业务流程的自动化与AI 化转型,为企业带来十倍运营效率和十倍用户体验。

  • 蚂蚁集团    蚂蚁数据语义层平台负责人王小军
    王小军
    蚂蚁集团 蚂蚁数据语义层平台负责人

    从 2020 开始,在蚂蚁数智平台先后参与负责了以下项目:

    数据建模:参与基于 OneData 方法论的规范建模项目,负责其中核心的 OneData 逻辑查询引擎建设;

    资产语义层:负责蚂蚁资产语义层的建设,包含业务词条、概念模型、指标语义层、指标翻译引擎等;

    资产智能化:负责蚂蚁资产知识库、资产智能化服务、资产智能化应用等能力,广泛应用于企业内部各个场景,为各类智能化应用场景提供高质量的、可信的上下文。

    26年,引入业界开源 OSI 协议,负责 AI 智能化爆发背景下的面向 Agent 的蚂蚁语义平台建设。


  • 马上消费金融 大数据总监赵雪波(元甲)
    赵雪波(元甲)
    马上消费金融 大数据总监

    互联网公司数据团队10+年工作经验,电商双11可视化直播大屏最早的建设者,互联网流量采集和计算标准最早建设者

    金融行业4年从业经验,建立时序、快照、标签等面向模型决策的复合用户数据资产


  • 京东集团 京东零售算法工程师吴旭晶
    吴旭晶
    京东集团 京东零售算法工程师

    京东零售广告数据分析 Agent 核心设计与开发者,长期关注自然语言问数、自动化报告和 Agent 工程化落地。当前主要负责京东广告数据分析 Agent 的能力设计与核心研发,覆盖智能问数、报告生成、订阅推送、异常归因、图执行和数据工作空间等方向。

  • 阿里控股企业智能事业部数字员工负责人董晓庆
    董晓庆
    阿里控股企业智能事业部数字员工负责人

    董晓庆(花名萧庆)高级技术专家,加入阿里巴巴15 年,参与或主导过多个阿里及蚂蚁的顶级开源项目,自2020 年开始专注于阿里巴巴办公产品的研发和架构设计,负责过多款内部高频AI 应用产品,目前是集团数字员工的负责人,构建了数字员工的申请、开通、培训、评测和上岗的全流程,已经有数百个数字员工进入实际应用。

  • 企查查 数据部AI负责人陈汝龙
    陈汝龙
    企查查 数据部AI负责人

    企查查数据部AI负责人,互联网行业从业12年,深耕算法、架构、云原生与工程应用,主要负责企查查业务线中的智能化数据治理。

  • 360集团 算法资深工程师常鸿宇
    常鸿宇
    360集团 算法资深工程师

    360人工智能研究院算法资深工程师。硕士毕业于北京理工大学,从事NLP及相关领域研究6年,主要研究方向为信息抽取,多模态内容理解,非结构化文档解析。

  • 高德商业智能部 数据分析专家钟雨洁
    钟雨洁
    高德商业智能部 数据分析专家

    多年商业分析与AI应用经验,现任高德AI应用组商业决策架构师。主导多行业智能诊断系统建设,具备Agent/Skills架构、NL2SQL、知识工程与端到端评测经验与能力,撰写《面向复杂业务场景的智能分析 Skills 架构设计与演进》刊登于阿里技术公众号,浏览量破1.3w(Top5)。

  • 高德商业智能部 数据技术专家荣柯柯
    荣柯柯
    高德商业智能部 数据技术专家

    荣柯柯(花名 柯俊),阿里巴巴数据技术专家,深耕数仓与 dataagent评测领域。主导 Data Agent 智能问数评测平台建设,构建四维评测体系与自动化评测 CI,精通 NL2SQL 评测、MaxCompute/AnalyticDB/Flink/SR 大数据栈及 Python/React 全栈开发。

  • XTransfer 高级产品总监陈文松
    陈文松
    XTransfer 高级产品总监

    现任XTransfer高级产品总监, 拥有14年跨行业复杂场景治理经验,具备电信级海量数据与金融级高可靠场景实操背景,深耕企业数字化转型与AI探索。

  • 高德 数据技术高级专家许晓巍
    许晓巍
    高德 数据技术高级专家
  • 高德商业智能部 数据产品专家林宇航
    林宇航
    高德商业智能部 数据产品专家

    职场履历覆盖头部外企、头部消费品牌等近10年的数据产品,主导企业内的多款数据产品的选型、落地与迭代,多次参与企业内外hackathon并获得头部名次。

  • 天弘基金 投研数据湖负责人田继龙
    田继龙
    天弘基金 投研数据湖负责人

    天弘基金公司投研数据湖负责人,主导公司从传统结构化数仓向多模态数据湖演进,构建覆盖研报、公告、路演音频等场景的数据治理体系,并探索LLM在投研数据挖掘中的工程化落地。

  • 高德 路线推荐核心算法负责人陈超
    陈超
    高德 路线推荐核心算法负责人

    陈超,2019年加入高德地图,至今7年专注路线推荐算法,现为路线推荐核心算法负责人。主导构建行业首个全场景统一路线推荐架构RouteMind,覆盖驾车、货车、公交、骑行等全场景,服务QPS 10万+。相关落地技术成果在KDD、WWW、Recsys、CIKM等顶会发表多篇论文。


  • 腾讯音乐娱乐集团 互动视频推荐、创新推荐负责人吴喆
    吴喆
    腾讯音乐娱乐集团 互动视频推荐、创新推荐负责人

    毕业于中山大学与香港科技大学,当前是TME互动视频推荐、创新推荐负责人,近期围绕生成式推荐与交互式推荐做了产品化落地,且其中部分工作已被CIKM2026接收。

  • 百度 资深工程师孟小萱
    孟小萱
    百度 资深工程师

    孟小萱,百度资深工程师,当前就任担任AI效能创新平台相关工作,致力于通过平台化、基建化的形态,通过AI赋能业务研发提效,并同时推动平台建设和实践落地工作。

  • Datastrato 资深软件工程师 / Apache Gravitino PMC Member李明皇
    李明皇
    Datastrato 资深软件工程师 / Apache Gravitino PMC Member

    李明皇,Datastrato 资深软件工程师、Apache Gravitino PMC Member,曾在滴滴从事三年大数据引擎研发,现专注企业语义层与 Data Agent。

  • 敦煌网 基础架构部总监窦东员
    窦东员
    敦煌网 基础架构部总监

    MBA,二十年IT从老兵,十年外企,十年互联网技术管理经验。

  • 江苏润和软件股份有限公司 人工智能中心 AI架构师杨冬瑞
    杨冬瑞
    江苏润和软件股份有限公司 人工智能中心 AI架构师

    东南大学博士毕业,曾就职于华为2012实验室,主导众核系统性能分析平台建设、AI辅助模型驱动开发工具开发、嵌入式agent开发等,曾获创新与技术突破奖,南京研究所十佳品质提升实践等。现就职于润和软件,主导基于本体的AI测试平台的开发和实践。

  • OPPO 数据平台部大数据架构师付庆午
    付庆午
    OPPO 数据平台部大数据架构师

    目前在OPPO数据架构组负责架构演进研发;Spark 开源RSS项目Shuttle发起人;Curvine高性能分布式缓存开源项目发起人;曾供职去哪儿网大数据,阿里云MC团队。

  • 天翼征信有限公司 总经理助理徐德华
    徐德华
    天翼征信有限公司 总经理助理

    负责企业征信数据产品、企业关系图谱与穿透式监管数据能力体系建设。

  • 得物 技术专家林风
    林风
    得物 技术专家

    本科毕业于大连理工大学、硕士毕业于同济大学,毕业后在网易、得物从事数据平台研发和AI Agent探索工作

  • 科锐国际  高级专家兼MiraDay 技术负责人王旭
    王旭
    科锐国际 高级专家兼MiraDay 技术负责人

    15年技术从业经验,经历过PC互联网、移动互联网,正在推动AI Native组织的转型

    曾任职于唯品会、万达网络、美团

    现在科锐国际担任高级技术专家 兼 MiraDay 技术负责人


  • 理想汽车  大数据平台负责人钱瀚
    钱瀚
    理想汽车 大数据平台负责人

    拥有十余年分布式大数据与AI基础设施建设经验,先后任职搜狗、百度、京东、字节跳动,现于理想汽车负责大数据平台。主导理想汽车大数据云原生、实时数据湖、元数据与语义层技术落地,服务百万级车辆大数据场景,承载万亿级车辆信号处理。

  • 蚂蚁集团   资深数据技术专家、蚂蚁消费信贷数据负责人崔伟斌
    崔伟斌
    蚂蚁集团 资深数据技术专家、蚂蚁消费信贷数据负责人

    现任蚂蚁集团资深数据技术专家,长期深耕消费金融、数据架构与数据智能领域。近年来重点探索大模型与数据技术的深度融合,围绕数据智能体、业务本体、智能分析与数据工程智能化开展实践,推动数据能力从传统的数据生产与分析,向“AI理解业务、智能体自主完成数据任务”演进。曾获多项国家专利,并受邀进行多次技术分享。

  • 美团   专家工程师高诗梦
    高诗梦
    美团 专家工程师

    毕业于电子科技大学,负责美团Agent评测平台建设。

  • 京东     零售算法工程师辜立忠
    辜立忠
    京东 零售算法工程师

    主导 DataAgent、B端超级助手、大数据 Copilot 等零售 B 端多个智能体项目从 0 到 1 构建与规模化演进,深耕多业务工具调用、多层级智能体架构、Memory 飞轮与长任务生产化,在 OxyGent 框架上沉淀了一整套 B 端 Agent 长期化生产的工程范式。

  • 理想汽车   高级算法工程师梁伟
    梁伟
    理想汽车 高级算法工程师

    数据智能部门负责人。长期参与智能问数、Data Agent与企业数据本体方向的技术探索,拥有从模型后训练到数据智能应用落地的实践经验。

  • Aloudata 大应科技    创始人 & CEO周卫林
    周卫林
    Aloudata 大应科技 创始人 & CEO

    20 余年大数据领域从业经验,是国内最早一批数据仓库先行者。曾任蚂蚁集团研究员(P10)、蚂蚁集团数据平台部总经理,蚂蚁集团数据技术主要奠基人,推动业务数据化、智能化体系建设和演进。现领导 Aloudata 以 NoETL 语义编织(Semantic Fabric)技术体系,构建 AI 可理解、可操作的数据底座。

  • Shopee      图平台负责人张松清
    张松清
    Shopee 图平台负责人

    深耕图存储与图计算图学习研发。2018 年起参与蚂蚁集团自研图存储系统从 0 到 1 建设,发表图数据专利2篇,后参与阿里搜索索引统一存储层研发。
    现负责 Shopee 图平台开发,覆盖图数据库、图计算与图学习服务以及一站式的图平台。

  • 某全球头部奢侈品厂商    大数据负责人谈总
    谈总
    某全球头部奢侈品厂商 大数据负责人

    某全球头部奢侈品厂商亚太大数据负责人,负责亚太区数据与技术战略,拥有奢侈品全球化多品牌多云数智基座建设经验,主导集团多云数据平台落地

  • 数新智能  CTO原攀峰
    原攀峰
    数新智能 CTO

    北京航空航天大学计算机硕士,十余年大数据、隐私计算的行业研发经验,国内外发明专利20篇。前阿里巴巴集团大数据平台高级技术专家,阿里御膳房、阿里云数加、DataWorks创始团队核心领导,0-1完成阿里云隐私计算平台DataTrust产品研发及商业化落地。

  • 易车  数据平台负责人王林红
    王林红
    易车 数据平台负责人

    长期深耕大数据与 AI 领域,曾主导多家公司大数据平台、数据中台从 0 到 1 建设。AI 时代,负责企业级 AI Agent 体系规划及落地,推动数据、语义、知识与执行能力平台化,推动企业数据从支撑分析走向支撑决策执行,构建人机协同的数据决策新范式。

  • 腾讯   高级算法研究员谢苑珍
    谢苑珍
    腾讯 高级算法研究员

    高级算法研究员,发表期刊会议(ACL, ICDM, KBS, WSDM, CIKM等)论文 11 篇。近年来专注于大模型在数据分析领域的前沿探索与落地,对 LLM Agent领域有深入研究。

  • 知乎  数据平台工程师汤晋瑄
    汤晋瑄
    知乎 数据平台工程师

    10余年大数据平台与实验平台一线开发经验,熟悉主流大数据技术栈,深知数据团队业务痛点。负责知乎 Data Agent 系统的架构设计与开发,致力于用 AI 技术提升数据团队生产效率。

  • ThinkingAI    Agent 首席架构师王浩强
    王浩强
    ThinkingAI Agent 首席架构师

    专注企业级 AI Agent 的技术架构与落地应用,推动数据分析、多 Agent 协作与业务执行融合,让数据洞察转化为可衡量的业务价值。

  • Datastrato    创始人兼 CEO,Apache Gravitino 项目发起人堵俊平
    堵俊平
    Datastrato 创始人兼 CEO,Apache Gravitino 项目发起人

    Datastrato 创始人兼 CEO,原 LF AI & Data 基金会董事主席,Apache 软件基金会成员,数据与开源领域专家。曾任全球 500 强企业开源业务总经理、腾讯开源负责人兼大数据研发总监、Cloudera Hadoop 团队负责人等。

  • 京东健康   AI 副总裁 智能算法部&医疗大模型 负责人胡浩源
    胡浩源
    京东健康 AI 副总裁 智能算法部&医疗大模型 负责人

    医疗大模型 · AI Agent · 金融 AI · 运筹优化

    个人简介
    长期从事人工智能、大模型与运筹优化的研究及产业落地,具备供应链、金融与医疗领域的技术研发、产品建设和团队管理经验。现负责京东健康智能算法部与医疗大模型,推动京医千询、MedCode、MedWiki 与 MedWork 等模型、技术及产品建设。此前担任蚂蚁金服金融 AI 与金融大模型负责人、菜鸟网络 AI 负责人。

    在 ICML、NeurIPS、Management Science 等国际学术会议与期刊发表论文数十篇,担任 SIGKDD 高级领域主席及 Applied Data Science Track 领域主席,兼任高校研究与教学职务。

    工作经历
    京东健康
    AI 副总裁|智能算法部 & 医疗大模型负责人**
    负责医疗大模型、智能算法与 Agent 技术体系建设,推动模型研发、医学知识、评测体系及产品应用协同发展,服务用户健康管理、医生工作与医院临床流程。

    大模型与核心技术
    - 京医千询 3.0:推动面向复杂医学任务的执行级模型建设,融合医学知识、多模态理解、工具调用与长程任务能力。
    - MedCode:建设医疗可执行推理能力,将指南规则、适用条件、计算与工具操作转化为可运行、可测试、可审计的执行步骤,通过执行反馈提升推理与任务质量。
    - MedWiki:建设结构化医学知识体系,结合 Agentic Search 组织指南、医学概念、证据等级与版本信息,支持主动查证和证据追溯。
    - 原生 3D 与多模态理解:围绕 CT、MRI 等场景,结合医生阅片操作轨迹、影像位置和诊断依据,推进影像理解与交互式阅片能力。
    - 长程任务执行:贯通检索、分析、工具调用与文档生成,建设任务检查点、错误定位和恢复机制。
    - 医学评测:推动 MedEviBench、MedRealMM、Med3DVQA 等联合评测与研究,结合医生审核标准、专业反馈和失败案例,持续优化模型及产品质量。

    产品与应用
    推动统一模型能力在用户、医生和医院场景中的应用,支撑京东健康 AI 产品体系:

    产品 定位
    | 大为医生 | 面向用户的问诊与健康管理服务 |
    | 京东知医 | 面向医生的医学循证检索与专业知识查证 |
    | 小康 | 面向用户的体重管理与健康服务 |
    | MedWork | 面向医生及专业团队的通用 Agent 工作台 |
    | 京东卓医 | 面向医院的工作流辅助 |

    MedWork 平台建设
    - 建设统一 Agent 执行底座、医疗通用能力与场景工作流,组织任务目标、输入资料、工具执行、人工审核及交付物。
    - 覆盖循证检索、病历归纳、门诊辅助、录音辅诊、AI-MDT、临床营养、用药辅助、影像及科研任务。
    - 提供文件与语音输入、云端与本机工作空间、多工具执行、任务沙盒、权限管理与审计能力,支持文档、报告、图表、代码和数据文件交付。
    - 推动医生个体使用与院内工作流落地,将专业能力沉淀为可复用的 Skill、连接器和标准工作流。

    蚂蚁金服
    金融 AI & 金融大模型负责人|财富保险事业群大模型委员会主席
    - 负责金融 AI 与大模型技术及业务应用建设,推动金融专业能力与财富、保险场景结合。
    - 建设 Finix 金融大模型,支撑蚂小财、蚂蚁财富等产品应用。
    - 支持蚂小财达到 3,000 万月活跃用户、蚂蚁财富达到 200 万日活跃用户。

    菜鸟网络 / 阿里巴巴
    菜鸟网络 AI 负责人|阿里巴巴供应链与运筹优化小组副组长
    - 负责 AI 与运筹优化技术在仓储、运输、履行和供应链场景中的应用。
    - 打造 Greed Solver,打破数十项世界纪录,创造十余亿元业务价值,相关工作入围 INFORMS Franz Edelman Award。
    - 获得 2015 年阿里巴巴 CEO 特别贡献奖,参与推动阿里巴巴个性化技术发展。

    学术任职与服务
    - 浙江大学客座研究员。
    - 上海财经大学硕士生导师。
    - 浙江工业大学客座教授。
    - SIGKDD 高级领域主席。
    - SIGKDD Applied Data Science Track 领域主席。

    学术成果与研究方向
    在 ICML、NeurIPS、Management Science 等国际学术会议与期刊发表论文数十篇,研究与应用方向包括:
    - 医疗与金融领域大模型。
    - 可执行推理、代码大模型与执行反馈学习。
    - Agent 任务编排、工具调用与长程任务执行。
    - 医学知识组织、主动检索与循证评测。
    - 多模态理解、三维医学影像与医生操作轨迹。
    - 供应链优化、运筹求解与业务决策。

    荣誉与奖项
    - INFORMS Franz Edelman Award Finalist。
    - INFORMS Daniel H. Wagner 奖。
    - 2024 年吴文俊人工智能科学技术二等奖。
    - 2015 年阿里巴巴 CEO 特别贡献奖。
    - 蚂蚁金服 T-Star 技术大奖。

  • 江苏润和软件股份有限公司   技术专家詹伶俐
    詹伶俐
    江苏润和软件股份有限公司 技术专家

    润和软件AI技术中心技术专家,南京大学工学博士学位,紫金山英才,2021年江苏省双创博士。博士期间从事计算机视觉、深度神经网络算子与网络结构、对抗生成深度神经网络等方向的研究。参与过:全军后勤系统“十二五”重大专项,裸眼立体视窗系统;装备预先研究计划,激光三维成像系统;国防工程配套项目,基于增量式深度学习系统的态势感知等。2020年-2023年,主导研发“基于云大智的下一代空管系统-NUMAN 5000”的智能化研发。2023年至今,主要负责润和AI相关产品研发,深耕垂类大模型、面向金融领域的RAG系统,面向测试领域的GUI agent,以及智能体平台基础框架研究。相关研究成果转化为发明专利10+篇:“一种端到端软件操作智能体的强化学习系统与方法”,"一种面向大模型在线学习的轨迹感知策略优化方法"、面向大型软件系统开发智能体的"一种基于双层动态索引的智能体记忆系统"等。

  • 京东  技术负责人legend
    legend
    京东 技术负责人

    毕业于北京大学,先后供职于多家互联网大厂,涉及到计算引擎、服务架构、广告平台、数仓及数据平台、Data+AI;深耕数据领域多年

  • PPIO    研发副总裁李星星
    李星星
    PPIO 研发副总裁

    长期深耕AI云基础设施、模型服务平台与智算产品研发,推动AI算力调度、AI推理平台及Agent基础设施的工程化落地,助力国产模型应用与企业数字化出海。

  • 观远数据  产品专家石凯
    石凯
    观远数据 产品专家

    数据领域资深产品专家,拥有10年以上行业经验,关注企业数据资产建设与决策知识的沉淀和复用,探索通过上下文工程与AI应用,推动企业从BI分析走向可解释、可评估的经营决策。

  • 小红书    模型工程负责人骆兆楷
    骆兆楷
    小红书 模型工程负责人

    2016 年加入 NVIDIA,参与 TensorRT 早期研发。2018 年加入阿里巴巴达摩院 AI Lab,参与自动驾驶计算中台建设。2020 年加入腾讯,从 0 到 1 主导搜广推领域深度学习计算框架的设计与落地;2023 年投入混元 LLM/VLM 训推 AI Infra 研发。2025 年加入小红书,担任模型工程负责人,统筹多模态大模型与搜广推 AI Infra 建设,并推动 hardware-aware co-design 驱动的下一代业务深度学习模型演进。

  • 京东科技集团  算法总监孟垂实
    孟垂实
    京东科技集团 算法总监

    京东科技总监、京东智能城市研究院高级研究员,副高级工程师。2018年获纽约州立大学布法罗分校计算机科学博士学位,长期从事机器学习、数据挖掘与智能agent研究及工程实践。获2021年北京科技新星、北京市经开区优秀人才,任中国计算机学会人工智能专委会执行委员,在KDD、SenSys、SIGSPATIAL、UbiComp等国际会议和期刊发表论文20余篇,被引1700余次。主导南通、大同、南京、上海普陀等地城市数字基础设施建设,负责智能研判、智能营销等垂类业务agent的产品设计与研发。

  • 活动日程
    2026-10-23
    2026-10-24
    2026-10-23
    09:00 -12:00
    主论坛
    2026-10-23
    09:10-09:50

    模型+全栈工程才是护城河:从医疗Agent到全行业启示

    演讲介绍:

    医疗 AI 正从问答辅助走向多步骤任务执行,而在医疗这样的严肃领域,AI 的每一次输出都必须确定性地正确。通用大模型直接落地面临根本困境:概率性检索结果不可控、推理导向模型不擅长执行、通用工程框架无法满足领域确定性要求、缺少闭环质量保障。

    以 MedWork 的产品与工程探索为背景,本次分享提出一个核心判断:当 AI 必须确定性地对时,需要重新设计的不是模型本身,而是从模型到知识到工程到交付的整个工程栈。我们将拆解四层重构:从推理模型升级为执行级医疗代码大模型;取消概率性 RAG,自研确定性 Agentic Search 与结构化知识体 LLMwiki;自研定向 Harness 实现任务编排与关键逻辑校验;以评测、执行记录、错误恢复与人工审核构建交付闭环。内容围绕任务定义、知识查证、可执行推理、长程任务恢复和产品交付展开,区分实验验证、产品建设与临床应用阶段,分享高要求场景下建设 Agent 的方法与取舍。


    演讲提纲:

    一、当 AI 必须每次都对:医疗 Agent 的目标与边界

    1)医疗 AI 的严肃性要求:从回答问题到完成任务

    2)通用大模型直接落地的四个困境:概率性检索不可控、推理导向模型不擅长执行、通用工程框架领域失配、缺少闭环质量保障

    3)我们的选择:重新设计从模型到知识到工程到交付的整个工程栈


    二、为什么"换模型"解决不了问题

    1)概率性检索(RAG)的不可控:检索结果不确定,知识无法精确校验

    2)推理导向模型的执行短板:模型擅长回答,不擅长完成任务

    3)通用工程框架的领域失配:无法满足医疗场景的确定性要求

    4)缺少闭环质量保障:没有评测、恢复、审核机制,错了不知道、错了不兜底

    5)结论:这些问题不是"模型不够强"造成的——这是工程栈的问题


    三、四层重构:从"大概率对"到"确定性地对"

    1)模型层:从推理模型到执行级医疗代码大模型——代码作为任务执行的承载层,让输出可校验、可回溯

    2)知识层:取消概率性 RAG,自研确定性 Agentic Search + LLMwiki——知识组织为可确定性导航的结构化知识体,按逻辑路径查证,来源可追溯、过程可审计

    3) Harness 层:自研定向 Harness(MedWork)——任务与交付物组织、工具调用约束、关键医学逻辑校验

    4)交付层:评测、执行记录、错误恢复与人工审核——以任务及交付物明确验收条件,为长程任务设计检查点和错误恢复,对关键结果设置专业审核环节


    四、结果:确定性交付的真实表现

    1)效果数据与三阶评估:区分模型成绩、任务成功与实际采用

    2)产品采用、交付成本与持续改进

    3)边界诚实:哪些做到了确定性,哪些仍在逼近


    五、方法论启示:工程栈才是 AI 的真正护城河

    1)从医疗场景到普适命题:金融、政务、制造的同样挑战

    2)工程栈的底层基石:数据的语义、知识的结构与上下文的组织


    听众收益:

    建立从用户任务、输入资料到交付物的 Agent 设计框架,理解从模型到知识到工程到交付的工程栈设计思路。
    理解知识检索、工具执行与结果校验的分工,掌握取消概率性 RAG、用确定性 Agentic Search 替代的方法。
    掌握围绕失败案例建立评测与回归检查的方法,理解端到端任务完成率、交付质量与人工干预率的多维评估。
    区分模型成绩、任务成功和实际采用,减少效果判断中的偏差,获得高要求场景下建设 Agent 的方法与取舍参考。


    落地挑战和方案重点:

    落地挑战
    医学依据更新、患者资料完整性、多步骤任务稳定性,以及结果质量与业务价值的衡量。在高要求场景下从"大概率对"走向"确定性地对"的根本性工程挑战:概率性检索结果不可控、推理导向模型不擅长执行、通用工程框架无法满足领域确定性要求、缺少闭环质量保障。

    方案重点
    四层工程栈重构:以执行级医疗代码大模型替代推理模型;以确定性 Agentic Search + LLMwiki 替代概率性 RAG,知识来源可追溯、查证过程可审计;自研定向 Harness(MedWork)实现任务编排与关键医学逻辑校验;以评测、执行记录、错误恢复与人工审核构建交付闭环。以任务及交付物明确验收条件,保留知识来源与执行记录,为长程任务设计检查点和错误恢复,对关键结果设置专业审核环节,通过失败案例、评测和使用反馈迭代。

    嘉宾
    DACon 2026 · 北京站
    胡浩源
    京东健康 AI 副总裁 智能算法部&医疗大模型 负责人
    2026-10-23
    10:20-10:50

    开放语义、Ontology 与元数据:Agent Context 的三重支柱

    演讲介绍:

    当 Agent 从回答问题走向推理、决策与执行,数据的可访问性已不足以支撑可靠的智能。Agent 不仅需要知道“数据在哪里”,还需要理解“数据意味着什么”“业务实体如何关联”,以及“行动受哪些规则约束”。如何将分散的数据、业务语义与治理规则组织为可信、可复用、持续更新的上下文,正在成为企业 AI 基础设施的核心命题


    演讲提纲:

    一、开篇:从数据连接到上下文构建的演进

    Agent 从回答问题走向推理、决策与执行,仅"数据可访问"已不足以支撑可靠的智能

    Agent 需要理解"数据意味着什么""业务实体如何关联""行动受哪些规则约束"

    引出核心命题:将分散数据、业务语义与治理规则组织为可信、可复用、持续更新的上下文,是企业 AI 基础设施的关键


    二、Agent Context 的三重支柱

    统一元数据——数据资产的描述与访问基础

    基于 Apache Gravitino 跨云、跨引擎、多模态数据的统一元数据管理实践

    为数据资产提供一致的描述与访问接口

    开放语义层——业务定义的跨工具共享

    指标、维度、业务定义标准化,消除"一个指标多个口径"

    让不同工具和 Agent 获得一致的业务理解

    Ontology(本体)——业务实体、关系与规则的表达

    建模业务实体间的关联与约束

    使 Agent 能将自然语言中的业务意图精确映射到真实数据

    三者衔接:统一元数据→开放语义层→Ontology 逐层递进,使 Agent 在明确治理边界内将业务意图转化为可执行的数据操作


    三、上下文基础设施建设:两种策略比较与更优路径

    自上而下(应用任务驱动)

    做法:从应用任务出发构建语义与本体

    优势:快速验证价值

    局限:容易形成重复建模、难以复用的上下文孤岛

    自下而上(元数据治理驱动)

    做法:从元数据与治理体系出发建立数据基础

    优势:覆盖面广,数据底座扎实

    局限:无法仅凭技术结构推导业务含义

    更可持续的混合路径

    以业务场景牵引建模

    以统一元数据连接业务概念、数据资产与治理规则

    通过业务校验和 Agent 使用反馈持续迭代

    让场景中的知识从"一次性建模"沉淀为"可共享的基础设施"


    四、产品化实践:从数据目录到 AI Context Platform

    Datastrato 2.0(Gravitino 2.0 企业版)发布

    融合统一元数据、开放语义与 Ontology 的产品化实践

    推动数据目录向 AI Context Platform 演进

    为不同应用与 Agent 提供一致、可信的企业上下文


    听众收益:

    1、建立对 Agent 上下文基础设施的完整认知框架:理解统一元数据、开放语义层、Ontology 三层递进关系,以及它们如何共同支撑 Agent 从"找数据"到"懂业务"再到"守规则"的推理与执行闭环。
    2、掌握上下文建设的两条路径——自上而下(应用任务驱动)与自下而上(元数据治理驱动)——各自的适用场景与局限,并获得"业务场景牵引建模 + 统一元数据连接 + 反馈迭代"这一更可持续的混合策略方法论。
    3、了解数据目录向 AI Context Platform 演进的产品化方向,获取可参考的架构设计与技术选型思路,为企业自身构建 Agent 上下文基础设施提供借鉴。
    4、获得治理视角的实践参考:如何在明确的治理边界内让 Agent 将业务意图映射到真实数据,兼顾上下文的可信性、可复用性与持续更新能力。


    落地挑战和方案重点:

    落地挑战:
    1、语义建模碎片化:不同应用各自构建语义与本体,形成重复建模、难以复用的上下文孤岛,跨场景知识无法沉淀共享。
    2、业务含义难以从技术结构自动推导:仅凭元数据与治理体系无法直接获得业务语义,需要业务侧深度参与建模,技术团队与业务团队的协作成本高。
    3、多模态、跨云、跨引擎数据的统一描述与访问缺乏标准:异构系统间元数据不一致,数据资产难以被 Agent 统一理解和调用。
    4、上下文持续保鲜难:数据漂移、业务规则变化、模型升级会导致已有上下文失效,缺乏自动化的校验与迭代机制。

    方案重点:
    1、以 Apache Gravitino 统一元数据为底座,提供跨云、跨引擎、多模态数据的一致描述与访问基础,解决异构数据资产的标准化问题。
    2、开放语义层让指标、维度和业务定义跨工具共享,避免"一个指标、多个口径"的语义孤岛,使 Agent 获得一致的业务理解。
    3、Ontology 表达业务实体、关系与规则,使 Agent 能将自然语言中的业务意图精确映射到真实数据资产与操作边界。
    4、以业务场景牵引建模,通过业务校验和 Agent 使用反馈持续迭代,让场景中的知识从"一次性建模"沉淀为"可共享的基础设施"。
    5、结合 Datastrato 2.0(Gravitino 2.0 企业版)的发布,分享融合三者推动数据目录向 AI Context Platform 演进的产品化实践,为参会者提供可落地的技术路径参考。



    嘉宾
    DACon 2026 · 北京站
    堵俊平
    Datastrato 创始人兼 CEO,Apache Gravitino 项目发起人
    2026-10-23
    10:50-11:20

    AI 时代,知识与本体的演进与思考 -- 从数据工程到知识工程

    演讲介绍:

    Harness 能力决定效果的下限,企业知识系统决定 AI 产生业务价值的上限。


    为什么企业已经建设了数据平台、RAG 和知识图谱,AI 仍然经常答不准、说不清、做不了?问题往往不只在模型和 Agent Harness,而在于企业缺少一套能够表达业务语义、关系、规则和上下文,并连接真实行动的知识系统。


    本体是组织企业知识的重要方式,但本体当前没有统一标准。Palantir、Snowflake、Databricks、Apache Ossie 与 Agent Memory 实际采用了五种不同路线。它们真正的差异不是 “有没有图”,而是知识如何表示、运行、生产和验证。


    本次演讲将从 DIKW 出发,拆解知识与本体的演进,比较五类主流技术路线,并给出企业从数据工程走向知识工程的落地路径。


    演讲提纲:

    AI 时代,为什么有了数据还不够


    知识、本体、Semantic Layer 与知识图谱的关系


    本体当前没有统一标准:五类主流路线如何选择


    企业知识建设的起点:内核、外围与开放接口


    持续知识工程的参考架构和案例:生产、评估、认证与更新


    听众收益:

    一张概念地图:厘清数据、知识、本体、Semantic Layer 与知识图谱


    一张选型地图:看懂五类主流方案的差异、边界与适用场景


    一条落地路线:从高价值业务域开始,建立可持续演进的企业知识闭环


    落地挑战和方案重点:

    挑战:企业知识分散、语义口径不一、本体没有统一标准,传统语义模型又容易成为难以维护的一次性交付。


    方案重点:从高价值结构化业务域切入,以 Semantic View 建立确定性语义内核,以 Context 和 Memory 补充长尾知识,以开放规范连接生态,并通过 AI ETL、Observability 和 Knowledge Engineering 形成持续闭环。


    嘉宾
    DACon 2026 · 北京站
    关涛
    云器科技 联合创始人&CTO
    2026-10-23
    14:00 -17:40
    金融可信 AI 实践(出品人:蚂蚁集团 资深数据技术专家、蚂蚁消费信贷数据负责人 崔伟斌)
    2026-10-23
    14:00-14:45

    蚂蚁集团金融数据知识本体:让Agent从"会查数"到"懂业务"

    演讲介绍:

    我们选择以数据知识本体打通多源业务语义,把字段/指标翻译为"用户""产品""行为"等业务对象,让系统理解数据在"说什么"。最大挑战是各业务线对"活跃用户"各说各话——我们不强行统一,让本体保留差异、

    Agent按需取用,并用LangGraph管线自动化完成本体合成与校验,并采用同步检索三类知识——KG_cs(业务视角,如花呗“活跃用户”的定义规则)、KG_fr(实体关系图,如“用户A-持有-借呗额度5万”)、RC(原始文档证据),三层结果经融合/去重/排序后打包为KnowledgePackage。

    效果:交叉机会识别缩至小时级,异动归因准确率超85%,策略落地效率显著提升。本体不是字典,是让系统"懂业务"的教材。


    演讲提纲:

    1. 问题:金融数据Agent为什么"会查数"但"不懂业务"?

    消费金融场景:数千张表分散在多业务线,同一个"活跃用户"花呗和借呗口径不同

    传统"按表取数"范式:Agent能找到表,但不知道字段在业务上"说什么"

    核心矛盾:字段/指标需要被翻译为"用户""产品""行为"等业务对象,让系统理解数据在"说什么"


    2. 方案:数据知识本体——不强行统一,让差异可管理

    用数据知识本体打通多源业务语义:把字段/指标翻译为业务对象

    核心设计原则:各业务线口径冲突时不强行统一,本体保留差异、Agent按需取用

    LangGraph六节点状态机实现自动化本体构建:逐表感知→实体识别→跨表矛盾消融→本体合成与校验

    "代码即标注":从历史SQL任务中反向萃取字段语义与表间关联,自动补充本体


    3. 落地:7层级消融+三层检索+三重校验

    7层级成本递进消融:从全自动合并到人工确认,冲突标记但不强制合并

    三层联合召回:KG_cs(业务视角口径定义)+ KG_fr(实体关系图)+ RC(原始文档证据),融合去重排序后打包为KnowledgePackage

    三重校验:Pydantic + 业务规则 + 深坑检测,不通过则重试或降级输出

    互索引架构:分层联合召回响应Agent分析请求


    4. 效果与踩坑

    效果:覆盖数千张表,交叉机会识别从3-5天缩至小时级,异动归因准确率超85%,已支撑多条营销策略落地

    踩坑①:极端情况(同字段名不同业务语义完全不同)自动合并准确率60-70%,约20-30%仍需人工——表规模扩展时人工确认成本线性增长

    踩坑②:当前被动响应用户提问,更高阶需求是主动识别业务变化并推送洞察——要求本体不仅"懂数据"还要"懂因果",KG_cs层因果表达能力薄弱是下一步突破方向


    听众收益:

    1. 掌握一套可复用的“海量表自动化本体构建”方法论

    2. 理解“分层联合召回”架构如何提升业务分析效率
    3. 获得“多业务线口径冲突”在金融场景下的实战经验


    落地挑战和方案重点:

    1、7层级成本递进消融策略在多数场景下表现良好,但在处理“同一字段名在不同业务线语义完全不同”的极端情况时,自动合并准确率预估约60%-70%,仍有约20%-30%的冲突需人工介入确认。当表规模扩展至数千张,人工确认成本随冲突数量线性增长,如何持续提升自动化消融准确率仍是持续攻坚方向。

    2、当前系统依赖用户提问触发分析(被动响应),但业务分析更高阶的需求是:系统能主动识别业务变化并推送洞察。例如“某消费贷产品近一周申请量异常下降”,系统需自主关联市场活动、竞品动态、风控策略调整等多维线索并生成归因假设。这要求本体不仅“懂数据”,还要“懂业务因果关系”,当前KG_cs层对因果逻辑的表达能力仍显薄弱,是下一步重点突破方向。




    嘉宾
    DACon 2026 · 北京站
    崔伟斌
    蚂蚁集团 资深数据技术专家、蚂蚁消费信贷数据负责人
    2026-10-23
    16:00-16:45

    从数据资产到可信决策,B2B跨境金融风控的AI产品化实践

    演讲介绍

    B2B跨境贸易风控长期面临“数据极复杂、信任极昂贵”的行业性难题:单笔交易高额度低频次、多方单证交叉核验、多国合规叠加,通用大模型与传统规则引擎均难有效应对。这背后的核心矛盾是——AI要真正进入金融决策链条,靠的不是模型参数规模,而是能否把碎片化、非结构化的行业数据转化为可信的语义资产与决策依据。本次分享将从数据体系构建、行业垂直模型训练、到低容错场景下AI从“能用”到“敢用”的工程化验证三个层面,拆解B2B金融风控AI产品化的通用方法论,并以XTransfer一线实践验证这套思路的可行性。


    演讲提纲

    一、B2B跨境贸易风控——一个“数据极复杂、信任极昂贵”的战场

    1.1 跨境B2B风控的特殊性

    ● 高额度与低频次——单笔风险敞口大,但样本量少,模型难以靠“大数定律”降误判

    ● 复杂贸易背景验证——一笔交易背后牵涉合同、物流、报关、发票等多方单证的交叉核验

    ● 强合规要求——多国反洗钱、反欺诈法规叠加

    ● 中小企业的金融可得性困境——传统银行因风控成本高而“不愿服务”中小外贸企业

    1.2 传统风控机制的瓶颈——为什么"不做AI"已经走不下去了

    ● 策略迭代周期长——规则库更新依赖人工梳理,跟不上贸易欺诈手法的变化速度

    ● 人工审核成本高——中小企业订单碎、频次高,人工逐单核验不具备规模经济性

    ● 规则死板导致高误拒率——一刀切规则把大量真实贸易误判为风险,反而伤害了“可得性”

    1.3 为什么通用AI方案“水土不服”?

    ● B2B贸易的数据特征:单证形态各异、数据线下化、非结构化、监管法规多种多样

    ● 通用大模型不懂“B2B贸易语言”

    1.4 产品的核心命题

    ● 不是“做一个AI风控工具”,而是构建一个让AI真正理解B2B贸易的数据产品体系

    二、B2B跨境金融风控AI化,必须迈过的三级台阶

    2.1 第一级台阶:从"数据"到"知识"——AI能不能看懂贸易语言

    行业问题:碎片化贸易数据,AI怎么理解?

    ● 产品判断:不是建“数据仓库”,而是建“数据体系”

    落地案例:XTransfer构建的B2B贸易知识图谱

    ● 构建跨境行业专业知识库

    ● 构建企业交易图数据库

    ● 关键产品能力:多源异构数据的标准化与语义化

    2.2 第二级台阶:从“识别”到“决策”——AI能不能做出可信判断

    行业问题:单靠一个大模型判断,为什么走不通?

    落地案例:B2B跨境贸易风控垂直大模型TradePilot

    技术支撑:


    ● 自训练行业垂直多模态模型 TradePilot

    ● 多源异构单证结构化提取

    ● 视觉伪造与篡改监测

    ● 交叉比对交易合理性

    2.3 第三级台阶:从“能用”到“敢用”——AI能不能安全地上生产环境

    ● 行业问题:低容错场景下,凭什么敢让AI做决策?

    落地难点:

    ● Agent效果保障体系:

    Agent测试

    沙盒模拟

    AB测试

    灰度双跑

    线上评测 / 监测

    2.4让决策“可解释”——金融可信AI的产品要求

    金融风控是低容错率场景,大模型不能替代整个风控过程

    ● 银行和监管最关心的三件事:

    大模型幻觉 vs 高确定性要求的冲突 → 严格结构化输出约束

    过程可观测,合规可审计

    数据安全与隐私保护

    ● 产品设计原则:AI辅助决策,而非替代决策

    ● 可溯源、可审计、可人工干预——产品级的可信保障

    关键产品能力:规则引擎 + AI模型 + 风控专家协同机制

    三、产品成果——用数据证明AI的价值兑现

    效果验证:

    交易自动化审核率:98.5%,行业最高

    欺诈率:控制在0.003%的行业极低水平

    风控成本:降低20%+

    四、产品启示——金融AI产品的三个“可信”法则

    法则一:数据可信 > 模型强大

    ● 金融AI风控的护城河不是算法,是高质量、可追溯的领域数据

    法则二:决策可信 > 能力炫技

    ● 要让合作伙伴、监管机构看得懂、信得过、审得了

    法则三:价值可信 > 概念领先

    ● AI产品最终要回答:省了多少钱、降了多少风险、提了多少效率


    听众收益

    1.一套跨机构可复制的B2B金融AI产品化方法论——“数据可理解→决策可自动化→结果可解释”的三级台阶,可直接对照自身机构AI风控建设所处阶段做诊断,而非依赖某一家公司的特定工具。

    2.低容错场景下AI从“能用”到“敢用”的工程化验证路径——沙盒模拟、AB测试、灰度双跑、线上监测这套流程,是行业内应对“AI敢不敢上生产环境”这一共性焦虑的可执行方案。

    3.应对大模型幻觉与监管合规双重约束的可解释性设计思路——结构化输出约束、过程可观测可审计,为行业提供一套可迁移的产品设计原则。


    落地挑战和方案重点

    1.自动化率与风险容忍度的行业性平衡难题。低容错金融场景下,提高AI自动化审核比例可能伴随误判/漏判风险上升。方案重点是建立“规则引擎+AI模型+人工专家”协同机制——AI负责风险信号发现,规则引擎守住可解释的硬底线,人工仅处理AI标记出的灰色地带,从而在高自动化率下把风险控制在可接受区间。

    2.非标、线下化行业数据的“可用性”瓶颈

    合同、物流、报关、发票等单证形态各异且大量线下化、非结构化,是所有跨境贸易场景在引入AI前都要先跨过的门槛——“数据不可用”往往先于“模型不够强”成为落地的第一道墙。方案重点是先建行业知识库与交易关系图谱,把碎片数据转化为AI可理解、可追溯的语义体系,再谈模型能力的叠加。


    嘉宾
    DACon 2026 · 北京站
    陈文松
    XTransfer 高级产品总监
    2026-10-23
    16:55-17:40

    翼支付:本体落地对金融可信AI的挑战——语义映射与对象存储的取舍


    演讲介绍:

    本体在企业里被讨论得很多,真正跑通的很少。我们在建设过程中反复撞上同一个问题:本体到底是一层"翻译",还是一份"数据"?


    只建映射,本体就是一层元数据,查询时翻译成对数据仓库的 SQL,数据不搬家,上线快、无冗余;但多跳穿透跑不动,口径受底层表结构牵制,对象的状态和执行结果没有地方落。真建一个对象库,把实例、属性、关系物化存下来,查得快、能承载状态、支持决策闭环;但要面对实时同步、增量一致性、存储成本和"谁是真值"这一堆问题。


    这个选择基本不可逆,而它的上游还有一个更容易被跳过的问题:概念口径和真实业务数据本来就不该混在一层做。本次分享完整交代我们在这两个问题上的判断依据、混合方案的边界划法、以及为此付出返工代价的几个决策,同时给出本体如何为智能体供数、跨域如何复用、项目以什么标准验收的具体做法。


    演讲提纲:

    一、业务背景:本体已经建成,智能体依然用不起来


    核心观点:模型能力不是瓶颈,企业数据"取不准、说不清"才是


    智能体数据访问路径分散,抽象层次不统一,效果不可比较


    三个现实瓶颈:缺少企业运行现实的表达、组织经验无法继承、单场景建设形成语义孤岛


    二、方案选型:概念口径与业务数据,为什么必须分两层做


    核心观点:一个模型既当知识描述又当运行态数据库,规模一上来一定散


    概念层的职责:对象、属性、关系、口径定义、业务规则与决策逻辑


    实例层的职责:亿级实例、持续变化的状态、历史链路与结果回写



    三、落地挑战:实例层是建映射,还是建实例库

    语义映射:轻量、上线快、无冗余;多跳受限、口径受制、状态无处安放

    实例存储:穿透高效、可承载状态、支持闭环;同步、一致性、成本与真值归属;但要结合具体场景,选择合适的存储模式


    四条选型判据:查询形态、时延要求、是否需要状态与回写、变更频率


    四、解决思路:混合方案与一致性保障


    核心观点:核心对象物化,长尾保留映射,边界必须写死而不是临场判断


    边界划法:哪些对象进对象库,两侧口径如何统一管理


    一致性约束:变更收敛完成前,受影响范围的查询结果必须显式标注口径状态


    面向智能体供数:最小必要上下文、受治理访问接口、回退条件与风险计量


    跨域复用:核心层与域扩展层的边界,复用率的正确算法


    五、未来规划与总结


    核心观点:本体建设的成败,最终由能不能被验收决定


    业务域资产交付五件套:本体片段、规则库、案例库、已验证查询、评测集


    度量原则:每项正向指标必须配一项成本或安全类反向指标


    从单域验证走向企业级语义基础设施


    听众收益:

    认知刷新:本体落地的真正难点不在建模方法,而在概念层与实例层的职责划分,以及实例层实现路径的不可逆选择。

    方法可复用:语义映射与对象存储的正面对比、四条选型判据、混合方案的边界划法,可直接用于自身架构决策。

    实践指南:面向智能体供数的具体设计与跨域复用规则,以及一套让本体项目可度量、可验收的交付模板与踩坑清单。


    落地挑战和方案重点:

    挑战一:概念与数据混合建模。 同一模型兼作知识描述与运行态数据承载,规模上升后无法维持。

    → 分离两层职责:概念层负责口径与规则,实例层只解决查得到、查得快、查得准。


    挑战二:实现路径选错且不可逆。 前期图轻选映射,遇到多跳穿透与状态回写需求只能推倒重建。

    → 依据查询形态、时延、回写需求、变更频率四条判据先行论证;核心对象物化、长尾保留映射,两侧口径统一管理。


    挑战三:口径可信度不足。 物化结果与源数据不一致而查询侧无感知,智能体依据过期口径给出确定性结论。

    → 增量更新配合失效传播,收敛前强制标注口径状态,宁可显式告知不确定,不做静默返回。


    挑战四:各域独立建设。 跨场景无法识别同一对象、无法复用规则,本体路线的价值主张难以成立。

    → 先立核心层与扩展层的划分标准和统一交付模板,以第 N 个域的交付人力下降幅度判定路线是否跑通。


    挑战五:建设成效难以证明。 项目常见的失败不是建不成,而是建成后无法证明优于原有方案。

    → 由业务专家产出金标准题库与盲评标准,保留 hold-out 部分;正向指标必须配反向指标。


    嘉宾
    DACon 2026 · 北京站
    徐德华
    天翼征信有限公司 总经理助理
    2026-10-23
    14:00 -17:40
    决策智能 Agent:从数据洞察到经营动作(出品人:Datastrato CTO 邵赛赛)
    2026-10-23
    14:00-14:45

    快手 Data Agent 的演进、核心设计与实践

    演讲介绍:

    今年以来,企业数据服务正从智能问数的 ChatBot 形态,逐步迈向能够理解业务知识、自主规划、完成复杂分析的 Data Agent。依托大规模数据基础和复杂多元的业务场景,快手在 AI for Data 方向进行了持续探索,并推出企业级 Data Agent,目前已在集团各业务线广泛应用。在报告生成、异动归因、A/B 实验分析、数据开发和业务洞察等高频场景中,实现了10倍以上的效率提升。


    本次演讲将结合快手的落地实践,系统介绍 Data Agent 的发展历程、设计理念与整体架构,重点分享知识工程、评测体系和数据飞轮等核心设计,并探讨 Data Agent 的未来演进方向。


    演讲提纲:

    1、快手 AI for Data 的发展历程 

    2、快手 Data Agent 的设计理念与架构 

    3、核心设计——知识工程

    4、核心设计——评测体系与数据飞轮

    5、Data Agent 未来展望


    听众收益:

    1、了解快手 Data Agent 落地的实践路径与方法论

    2、掌握 Data Agent 在架构设计、知识构建、效果评测和持续迭代方面的核心思路

    3、获得企业落地 Data Agent 的实践参考,帮助识别适用场景、建设重点与演进方向


    落地挑战和方案重点:

    1、数据知识复杂且存在歧义

    统一治理指标口径、业务术语和元数据,通过知识检索与歧义澄清,提高业务理解的准确性。

    2、分析链路长,准确性要求高

    加强任务规划、工具调用、结果校验和过程溯源,提升复杂分析的准确性与可信度。

    3、效果评估难,能力需要持续迭代

    建立覆盖分析全链路的评测体系,结合真实问题和用户反馈形成数据飞轮,推动能力持续优化。


    嘉宾
    DACon 2026 · 北京站
    张蕤
    快手 数平产品技术中心负责人
    2026-10-23
    14:55-15:40

    30 分钟上岗:企业“招聘” Data Agent 的新标准

    演讲介绍:

    随着 Data Agent 从 PoC 验证进入生产应用,企业关注的问题正在发生变化:过去更关心产品能不能上线、演示效果好不好;现在更关心 Agent 多久能够接手第一项真实任务,能不能可信地完成工作,并在使用过程中持续学习。

    传统软件是“造工具”,产品完成部署、用户能够操作,就可以称为上线;Data Agent 更像企业新招聘的一名数字分析师,连接数据、获得权限只是拿到了“工牌”,只有能够理解任务、主动开展工作并交付可信结果,才算真正上岗。如果仍然需要企业先花数月时间准备完整的语义、知识和工作流程,Agent 才能开始工作,那么就没有几个企业可以雇佣这样的 Agent。

    本次演讲提出“30分钟上岗”这一新的 Data Agent 评价标准。在基础部署和数据授权已经完成的前提下,Data Agent 应当能够快速适应企业现有的数据环境,围绕第一项真实任务主动探查数据、澄清业务需求、开展可信执行,并在工作中积累经验。

    一个能够上岗的 Data Agent,至少应当具备四种可观察的工作能力:摸得清、问得准、干得对、学得会。本次演讲将介绍这一标准的业务背景、能力要求和产品机制,并结合真实业务案例,展示 Data Agent 如何在企业中快速上岗、边干边学。


    演讲提纲:

    Data Agent 新挑战:从“上线”到“上岗”

    a.产品“上线”,不等于 Data Agent 能“上岗”

    b.从“造工具”到“招员工”

    Data Agent 新要求:30 分钟上岗

    a.什么是“30 分钟上岗”

    Data Agent 新标准:四个上岗能力

    a.摸得清:自适应企业环境,自主探查数据

    b.问得准:自主澄清业务需求

    c.干得对:自主规划,可信执行

    d.学得会:自学习,受控自进化

    Data Agent “30 分钟上岗” 案例介绍


    听众收益:

    1.获得一套区别于模型能力和功能清单的 Data Agent 评价框架,理解企业为什么应该从“产品上手”转向“岗位上岗”。

    2.掌握“摸得清、问得准、干得对、学得会”四项可观察的工作标准,并能够将其用于 Data Agent 的选型、测试和验收。
    3.获得一套以真实任务为核心的“入职考试”方法,用于判断一个 Data Agent 是否具备进入生产环境的基本能力。


    落地挑战和方案重点:

    1.企业数据语义不完整,Data Agent 冷启动周期长,如何快速完成语义层的冷启动和持续迭代。
    2.业务需求灵活多变,数据语义难以第一时间覆盖完整,Data Agent 如何主动有效澄清需求。
    3.如何构建 Data Agent 的持续学习体系,并且保证不失控。




    嘉宾
    DACon 2026 · 北京站
    周卫林
    Aloudata 大应科技 创始人 & CEO
    2026-10-23
    16:00-16:45

    从 BIRD 第三到生产可用:小米 Data Agent 落地实践

    演讲介绍:

    小米团队在 BIRD 全球 Text2SQL 评测中斩获第三,但更重要的问题是:如何让这个能力在真实业务中持续变准、越用越好?我们的答案是:把 BI 平台多年积累的语义层变成 AI 持续进化的燃料——低成本构建领域评测集,驱动效果闭环迭代,并基于已验证的评测集同步提升准确率与响应效率。今年我们进一步开放 CLI 能力,让用户通过自然语言完成知识沉淀与效果迭代。本次分享还原这条路径的核心取舍,为行业Data Agent 落地提供参考。


    演讲提纲:

    1、小米Data Agent介绍
    2、落地挑战与解法
    3、实践案例
    4、经验与展望


    嘉宾
    DACon 2026 · 北京站
    方彪
    小米高级算法工程师
    2026-10-23
    16:55-17:40

    让Agent进入经营决策流程——语义治理、归因诊断与管理研判

    演讲介绍

    本地生活业务覆盖20多个行业,商业模式、指标口径和经营重点差异大,人工分析慢,经验难复用。Agent方案采用三层架构:语义治理统一业务口径与知识,归因诊断定位指标变化和经营根因,管理研判将结论转化为行动方向。累计沉淀6.6万条可追溯知识,分析效率提升64倍,业务认可率100%。


    演讲提纲

    主线:经营材料与指标→语义治理→确定性归因→LLM推理→受约束研判→证据门禁与交付→反馈回流

    一、开场:经营分析的最后一公里——20+行业不同商业模式/指标口径

    二、业务决策Agent的架构选择——三次演进,收敛为三层架构:语义治理层/归因诊断层/管理研判层

    三、语义治理建立业务共同语言——知识架构"编辑—编译—发布—消费"四段式;6.6万条可追溯知识,198条消费路径,186条直接服务

    四、确定性归因托住经营诊断——指标恒等式闭合→异常检测→LMDI→趋势分析→维度下钻;新行业接入从半月缩短至1天,效率提升64倍

    五、管理研判推动洞察进入经营流程——Guard拦截遗漏信号/无来源数字/因果升级

    六、实践成效:效率提升64倍、6.6万条知识、业务认可率100%

    七、未来规划:报告闭环走向行动闭环

    八、结语:决策智能是一套责任体系


    听众收益

    1. 建立决策智能Agent的完整架构认知——三层职责划分与大模型/确定性引擎/知识系统的协同

    2. 掌握复杂业务场景的关键工程方法——知识结构化治理/确定性归因/证据追溯/版本管理/失败阻断

    3. 获得Agent进入经营流程的落地经验——经营体检/专题诊断/管理研判/行动建议的衔接


    落地挑战和方案重点

    1、业务语义分散与持续变化,导致 Agent 对指标和经营问题产生错误理解

    同一指标可能存在多套口径、业务身份、适用范围和时间版本,碎片化知识容易引发语义漂移。方案重点是建立统一的语义治理体系,对指标、规则、关系和经验进行结构化管理,并提供 Scope、版本、来源追溯和显式失效机制。


    经营洞察缺少证据约束,难以稳定进入管理决策流程

    模型生成的归因和建议可能出现数字偏差、因果升级或责任边界模糊。方案重点是通过确定性引擎完成计算与归因,以大模型承担受约束的业务研判,再结合证据绑定、Guard、失败阻断和复盘条件形成可审计的决策支持。


    嘉宾
    DACon 2026 · 北京站
    钟雨洁
    高德商业智能部 数据分析专家
    2026-10-23
    17:40-18:25

    让 Data Agent 的每个回答都有据可查:企业级可信问数的工程闭环

    演讲介绍:

    Data Agent 完成 Demo 不难,但进入生产要过这四道坎:语义难维护、执行难可靠、权限难继承、效果难量化。本演讲围绕「建模—编译—维护—评测—治理」的工程闭环逐一拆解:统一指标语义并编译为可执行 SQL,持续检测语义漂移、以评测集驱动回归,用业务域与标签策略落地细粒度权限;并以开源的 Apache Gravitino 为例,结合数千指标规模的真实场景与效果数据,展示 Agent 从「能答」走向可用、可信、可控。洞察可信,经营动作才敢自动化。


    演讲提纲:

    1. 为什么 Data Agent 容易完成 Demo,却难以进入生产
    聚焦两个根本问题:一是随着指标和业务关系规模增长,语义难以持续维护;二是问数过程缺少可执行、可溯源、可评测且受权限控制的工程闭环。

    2. 让 Agent 在正确的业务范围内工作
    通过 Domain/Organization 将跨 Catalog、Schema 的资产组织起来,确定 Agent 的发现与检索范围;同时将“能够看见哪些元数据”与“有权访问哪些数据”分开治理。

    3. 建立统一、可计算的指标语义层
    为什么需要统一的语义层,以及如何使用 Apache Gravitino SemanticModel 统一承载 Apache Ossie 语义模型,解决同名指标、相似指标与口径冲突。

    4. 让每个问数回答都有据可查
    Agent 不直接猜测业务口径或自由生成 SQL,而是调用受控的确定性工具完成资产发现、语义解析、查询编译与执行,系统不仅返回结果,还记录其语义依据、数据来源和工具调用链,使回答能够被解释、复现和审计;遇到歧义或不安全关联时,则要求澄清或拒绝执行。

    5. 让权限与业务语义协同治理
    通过业务域、Tag、Policy 和既有 ACL,将资产分类、细粒度授权与审计串联起来,并与目标查询引擎的数据访问控制协同执行。

    6. 从“一次答对”走向“持续可信”
    Semantic Generator 基于 metadata、query history 和 domain knowledge 生成有依据、可审核的语义 proposal;结合确定性校验、人工 review、漂移检测和回归评测,持续发现语义变化与效果退化。 

    7. 从业务问题走向可信回答
    通过端到端 Demo 串联前述能力,展示 Agent 如何确定业务范围、理解指标语义、调用确定性工具完成查询,并在权限约束下返回可解释、可复现、可审计的回答。


    听众收益:

    1. 掌握一套判断 Data Agent 是否具备生产条件的方法,覆盖业务范围、语义模型、可信问数、权限治理与持续评测。  

    2. 理解如何通过 SemanticModel 与受控工具链,把自然语言问题转化为可执行、可溯源、可审计的问数回答。  

    3. 获得语义生成、漂移检测和评测回归的落地思路,降低指标规模增长与业务变化带来的维护成本。


    落地挑战与方案重点:

    1. 当企业拥有数千个指标、复杂业务关系和持续变化的口径时,如何降低语义层的建设与维护成本,并及时发现语义缺失、冲突和漂移。  

    2. 如何把 Agent 的自然语言理解转化为可执行、可解释、可回归、受权限控制的查询结果,而不是仅生成一段看似合理的 SQL。

    嘉宾
    DACon 2026 · 北京站
    李明皇
    Datastrato 资深软件工程师 / Apache Gravitino PMC Member
    2026-10-23
    14:00 -17:40
    Agentic Workflow:数字员工与企业流程重构(出品人:阿里控股企业智能事业部数字员工负责人 董晓庆)
    2026-10-23
    14:00-14:45

    从工作流到智能体集群:企业级多租户数字员工的工程化落地与协同实践

    演讲介绍:

    早期我们使用 AI 工作流实现AIOps业务,但业务演进与 AI 规模化落地后,预定义节点模式难以适配复杂动态任务,不支持记忆沉淀、多智能体协同、租户隔离等高阶能力。

    为此我们基于 HermesAgent 底座,自研企业级多租户数字员工系统,已在 SRE AIOps 规模化落地,并拓展至营销、客服、DevOps 等多场景。本次报告分享我们数字员工的 Agent 工程化、多租户治理、记忆知识及多智能体协同的实践方案与行业经验。


    演讲提纲:

    一、演进背景:从AI工作流到企业级数字员工集群


    早期技术现状:基于AI工作流完成线上落地,可满足固定流程自动化需求

    范式核心瓶颈:工作流灵活性不足,无法动态决策、持久化记忆、多角色协同,不适配复杂长链路业务

    业务升级诉求:企业规模化落地,亟需多租户隔离、精细化权限、可治理、可进化的智能体能力

    技术方案升级:基于HermesAgent自研企业级多租户数字员工系统

    落地全景:深度落地SRE AIOps,同时覆盖营销、客服、DevOps等多业务线,具备通用落地能力


    二、技术架构:HermesAgent多租户数字员工集群核心建设


    整体架构:分层集群架构,支撑数字员工规模化、高可用企业落地

    云原生能力:基于K8s实现云端部署、弹性调度,保障集群稳定运行

    多租户隔离:实现数据、会话、记忆三层隔离;轻量化隔离仍有短板,存在越权、数据泄露风险

    企业权限体系:对接SSO实现统一Token鉴权;工具、技能调用缺乏统一权限底座,标准化不足

    Skill标准化:统一认证规范,兼容本地/SAAS双模式,厘清技能边界与互斥规则

    CoT工程创新:标准化思维链规范推理、剔除冗余思考,提升精准度与性能;原生模型推理冗余、响应慢,需持续优化

    落地形态:覆盖个人、团队、全员共享数字员工,包含通用问答、专项技能两类形态

    全局性能瓶颈:大模型及Agent原生推理链路耗时高,无法满足业务毫秒级响应诉求,推理冗余、耗时不可控,是行业规模化落地的核心共性难题


    三、治理体系:记忆+知识+技能协同,构建Agent自进化飞轮


    核心能力分层:明确数字员工、Skill、知识库、长效记忆的定位与协同关系

    可管控记忆体系:规则化记忆约束模型输出;当前规则分散、易被绕过,输出一致性较弱

    CoT+记忆联动:结合业务长效记忆与标准化思维链,保障推理输出稳定可追溯

    多源知识接入:支持专属、业务、企业存量知识及知识图谱多形态接入

    自进化飞轮:形成业务运行-经验沉淀-知识迭代的能力闭环;知识库召回精度不足,存在错配、遗忘问题


    四、场景落地:流程+状态机驱动的多智能体协同模式


    创新协同架构:搭建流程+状态机标准化多智能体协同体系,替代无序协同模式

    角色分工机制:单员工绑定专属职责与任务状态,权责清晰、专人专事

    状态流转机制:通过标准化状态变更、任务交接,驱动复杂业务全自动闭环

    核心落地场景:落地SRE AIOps全链路场景,实现故障处置、修复、代码提交自动化,完成运维能力右移

    通用能力验证:多业务线落地,验证平台全域复用能力

    现存协同短板:多Agent协同体系不成熟,缺少标准化管控,任务交接、闭环作业能力不足


    五、总结与未来演进方向


    范式升级总结:从无状态工作流自动化,升级为可记忆、可管控、可协同、可进化的数字员工自治体系

    核心落地结论:企业级Agent核心壁垒为工程化、治理、安全与协同能力,而非单纯模型能力

    未来迭代方向深耕性能优化,解决大模型/Agent推理耗时问题,突破毫秒级业务响应瓶颈,精简推理冗余链路

    优化CoT精细化推理逻辑,进一步提升模型输出准确率与稳定性

    迭代知识库治理能力,优化精准召回,解决知识错配、遗忘问题

    完善流程+状态机协同框架,补齐多智能体标准化协同、闭环管控能力


    听众收益:

    1,企业数字员工、Agent 工程实践:学习多租户隔离、Skill 体系、工程化 CoT 思维链的落地思路,了解如何解决记忆管控、权限治理等生产环境实际难题。

    2,数字员工多智能体协同方案:了解基于流程 + 状态机的数字员工分工协作模式,借鉴 SRE‑AIOps 及多业务线真实落地经验。

    3,数字员工生产级问题的解决思路:了解数字员工在记忆治理、技能管控、租户安全方面的实战方案,可直接复用至内部 Agent 平台建设。


    落地挑战和方案重点:

    1,数字员工能力的沉淀和进化。随着场景增多,skill泛滥、业务与运维经验零散无序、散布各处,如何确保数字员工高效工作、快速响应、持续进化。

    2,大模型及Agent全局性能提升:大模型及Agent原生推理链路耗时高,无法满足业务毫秒级响应诉求,推理冗余、耗时不可控。



    嘉宾
    DACon 2026 · 北京站
    何碧宏
    杭州群核信息技术有限公司 SRE团队负责人、软件开发专家
    2026-10-23
    14:55-15:40

    从 Workflow 到数字员工:一个生产级数据分析 Agent 的架构与落地

    演讲介绍:

    数据分析场景中,通用大模型直接落地"不够好":业务口径不懂、SQL 出错、上下文爆炸、执行跑飞。我们历经两年,从 Workflow 演进到 Agentic 架构,沉淀出"好 Agent = 好模型 × 好架构 × 好知识"的乘法公式,做成数据AI助手——一个能独立完成"取数→分析→可视化→报告→例行化"全流程的数据分析数字员工。智能问数、深度分析报告、对话内可视化看板、AI 画图、例行化任务等能力开箱即用,替代了分析师从需求接收到交付的多个手工环节,将数据分析任务从数天缩短到分钟级,提速10倍+。
    本次分享从数字员工视角拆解其架构体系:数据语义库、Skill 技能系统与知识自进化(越用越懂业务)让模型懂业务;Agent 架构、上下文压缩等让模型跑得稳;模型调度策略与 MCP 工具生态让模型组合发力;评测驱动开发(EDD)让效果可度量。我们也将讨论数字员工与人工分析师的协作边界——哪些任务全自动、哪些需要人工确认、哪些仍需人工主导,以及在什么环节需要人工兜底。


    演讲提纲:

    一、破局之道:数据分析的痛点分析与破局思路

    1)需求排队、口径混乱、重复劳动;单轮问数的 ChatBI 与"会做事"的 Data Agent 的本质差异——从 Workflow 到 Agentic 的范式跃迁。数据分析的数字员工不是更大的 Copilot,而是能独立接需求、规划分析路径、调用工具、生成交付物的端到端执行体

    2)落地挑战:Agent 落地的"八面围城"——知识碎片化、工作流桎梏、上下文困境、记忆缺失、单模型局限、工具调用不可靠、流程难复用、经验不沉淀

    3)数据AI助手全景架构和功能蓝图

     

    二、匠心独运:数据AI助手核心架构解析

    从数字员工视角看架构:数据语义层=分析师的业务理解力,Skill 系统=分析师的方法论工具箱,记忆系统=分析师的经验积累,上下文工程=分析师的注意力管理。本节揭秘核心架构模块:数据语义层、Agent 架构、上下文工程层、记忆系统层、LLM 调度层、工具与协议层、技能系统层、自进化层。

     

    三、知行合一:Agent 的评估与质量保障体系

    数字员工的效果如何度量:不是 SQL 准确率单一指标,而是端到端任务完成率、交付质量、人工干预率的多维评估。评测驱动开发(EDD)的实践方法。

     

    四、大显身手:数字员工如何端到端完成数据分析任务

    以一个真实业务场景(运营周报自动生成)为主线,展示数字员工如何走完整个流程:

    ① 智能问数——一句话 → 取数 → 图表

    ② 深度分析——多步规划,自动生成分析报告

    ③ 可视化看板——对话内生成交互式 HTML 看板

    ④ 例行化任务——日报周报定时自动跑

    ⑤ 扩展能力:AI 画图、Skill + 自定义 MCP 开放能力生态

    ⑥ 数字员工与人工分析师的协作边界:哪些任务全自动、哪些需要人工确认、哪些仍需人工主导

     

    五、行稳致远:总结

    乘数效应、工程重心从 Prompt 到上下文工程、知识沉淀是会自己加深的护城河、评测驱动开发。数据分析数字员工的下一步:从单场景数字员工到多数字员工协作(分析师 Agent + 工程师 Agent + 运营 Agent)。


    听众收益:

    1.生产级数据分析数字员工的架构设计思路与落地实践——从 Workflow 到 Agentic 的演进路径
    2.数字员工端到端完成数据分析任务的工程实现:数据语义层、知识自进化、上下文工程、Skill 系统等
    3.数字员工与人工分析师的协作边界设计——哪些全自动、哪些人工兜底、如何度量数字员工的效果
    4.企业构建自己的数据分析数字员工可借鉴的架构模式与避坑经验


    落地挑战和方案重点:

    Agent 落地的"八面围城"及其解法——两年生产实践中,我们遇到八个核心挑战,每一个都催生了架构中一个对应模块的落地:知识碎片化、工作流桎梏、上下文困境、记忆缺失、单模型局限、工具调用不可靠、流程难复用、经验不沉淀。
    方案重点:Agent 核心架构设计、上下文方案、自进化策略等。此外,数字员工的流程治理同样关键——如何界定数字员工的权限边界(只能取数和画图 vs 能否直接发送报告),如何设置人工审批节点,如何保障输出合规;以及从单个团队试点到全组织推广时,数字员工如何适配不同业务线的差异化口径和流程。




    嘉宾
    DACon 2026 · 北京站
    谢苑珍
    腾讯 高级算法研究员
    2026-10-23
    16:00-16:45

    从单 Case Copilot 到跨 Case Agent Mesh:金融风控 AI 的 A2A 架构与可信落地

    演讲介绍:

    在金融风控与合规审核中,真正困难的不是再做一个能对话的 Agent,而是让 AI 在真实 case system 上获取正确上下文、理解领域规则、保留证据链,并在跨系统联动时不越权。

     我们从 Business KYC、Individual KYC、KYB、MRM 等真实场景出发,逐步建设 Case Copilot 平台将分散在代码、API、规则配置、SOP 和领域人员经验中的知识沉淀为可测试的 domain skills,再通过统一的 context、orchestrator、evaluation、trace 以及 UI/API 接口交付给审核人员。

     在这个过程中,我们遇到了许多典型的生产问题:巨大 prompt 导致结果不稳定,长链路调用出现 gateway timeout,动态数据缺乏可靠 snapshot,调用超时不代表下游任务没有执行,不同角色需要的信息粒度完全不同,而单个 Agent 的准确率达标,也不代表完整 workflow 可以安全上线。

     基于这些实践,我们最终完成了“每个 case system 一个独立 domain agent”的架构。各 agent 保留自己的事实、规则和 decision ownership,通过 A2A contract 暴露受治理的能力;其上的 Cross-Case Orchestration Layer 负责生产环境中的能力发现、任务跟踪、证据关联、冲突识别和跨 case 分
     析。

     生产编排并没有交给一个全权自主的“大脑”,而是采用 deterministic workflow + bounded LLM planner:确定性代码负责权限、状态、重试、补偿和高风险动作,LLM 只负责模糊意图拆解以及受限的动态路由。


    听众收益:

    本次分享展示的不是理想化 Demo,而是一套已经完成生产落地的多 Agent 系统,以及它从单 case Copilot 演进到跨 case agent mesh 的完整过程。我们将复盘哪些方案有效、哪些假设失败,并拆解 Agent Card、Task/Artifact contract、权限传播、版本管理、闭卷评估、decision-level trace、 human gate 和降级机制如何共同支撑生产运行。

    参会者可以带走一套经过真实业务验证、可复制、可量化、可审计、可回滚的多 Agent 分层架构与迁移方法。

    落地挑战和方案重点:

    第一,Agent 如何真正理解业务。金融风控知识并不集中在一份文档里,而是分散在代码、API、规则配置、SOP 和领域专家经验中。我们的方案是从这些真实来源生成 domain knowledge,再由领域负责人审核和版本化,最终沉淀为可测试、可复用的 skills。

     第二,如何解决巨大 Prompt 带来的不稳定性。早期把大量判断逻辑放在一个 Prompt 中,会导致多次运行结果不一致,一个局部错误也可能污染整个 summary。后续我们把完整判断拆成独立的 checkpoint skills,让每项能力可以单独开发、评估、缓存、上线和回滚。

     第三,如何处理长任务和超时。生产环境中出现过 gateway timeout,但调用方超时并不意味着下游任务没有执行。如果直接重试,还可能造成重复操作。我们的方案是使用 A2A Task 管理任务生命周期,通过唯一 Task ID、幂等 key、异步状态查询和 Artifact 持久化,保证任务可以追踪、恢复和去
     重。

     第四,如何处理跨 Case 的事实冲突。不同 case systems 的数据更新时间、规则版本和业务语义并不完全一致。统筹层不能让 LLM 静默选择一个看起来合理的答案,而是要求每个 Agent 返回数据来源、观察时间和版本信息。当结果不一致时,系统生成明确的 conflict artifact,并将问题交给正确的
     domain owner。

     第五,如何控制 Agent 的权限和责任边界。上层 orchestrator 可以组合领域能力,但不能替代各 case system 的 decision ownership。我们把能力分成 Read、Analyze、Propose 和 Act 四个等级。读取和分析可以在授权范围内自动执行,而修改 case、发送 RFI 或改变 workflow 状态等高风险动
     作,必须经过确定性权限检查和人工审批。

     第六,如何避免多 Agent 的误差叠加。单个 Agent 的准确率达标,并不代表多个 Agent 组合后的完整流程仍然安全。因此除了对每个 Agent 做独立 benchmark,还需要对端到端 workflow 进行评估,比较 human baseline、material error、证据完整性、路由准确率和 unsafe action rate。

     第七,如何让系统安全失败。当某个 Agent 超时、不可用或 schema 不兼容时,统筹层必须返回明确的 partial result,说明哪些结果已完成、哪些领域暂时不可用,而不是用模型补全缺失信息。系统还需要具备 circuit breaker、capability kill switch、旧版本回退和人工流程降级能力。

     第八,如何服务不同角色。相同的证据对不同用户具有不同意义:Risk 需要完整 evidence,Ops 需要 next action,CS 只关心由谁处理以及哪些信息可以向客户解释,管理者需要跨 case 趋势。我们的方案是在共享 evidence 之上生成 role-specific output,而不是把同一份冗长 summary 发给所有人。


    嘉宾
    DACon 2026 · 北京站
    董大凡
    Airwallex 空中云汇 架构师
    2026-10-23
    16:55-17:40

    几百个数字员工在阿里上岗:Agent Loop框架、MCP双模式与多Agent协同的落地经验


    演讲介绍:

    企业AI落地正在从"给员工配AI工具"走向"让AI成为组织的一员"。数字员工拥有正式工号、纳入企业架构管理,在真实工作流中与人类同事协同,而非作为独立黑盒运行。

    本次分享从RPA→智能助手→数字员工的三阶段演进出发,拆解数字员工与传统Agent的本质差异,结合项目管理、业务感知、分层答疑、销售运营、跨组织沟通等典型场景展示落地实践,并系统介绍五大核心能力模块的架构设计。最后基于几百个数字员工上岗经验,总结四条关键经验与三个未来判断。


    演讲提纲:

    一、定义与差异

    从RPA到数字员工的三阶段演进

    数字员工vs传统Agent的六大差异:身份、权限、知识、业务接入、交互、安全

    核心差异:兼容现有工作方式、人机协同、嵌入工作流、多Agent协同

    二、企业场景

    项目管理:任务分配、进度追踪、自动报告

    业务感知:数据融合洞察、指标归因、风险预警

    分层答疑:知识隔离、智能升级、知识回流

    销售运营:客户沙箱、拜访策略、反馈闭环

    跨组织沟通:外部群入驻、信息内部化、安全应答

    三、核心实现

    身份与组织管控:工号体系、权限重构、生命周期管理

    渠道与业务接入:多渠道触达、API打通、技能市场、事件驱动

    知识及记忆管理:多源采集、实体抽取、分层授权、管理员副驾驶

    安全和权限管理:可达性控制、MCP双模式、容器隔离、全链路审计

    Agent接入:Agent Loop框架、三方接入、垂域共建、共享与隔离双模式

    四、实践经验

    价值优先:不追规模,ROI驱动扩展

    提效赋能:不替代岗位,释放创造力

    安全为纲:安全/法务/合规从第一天参与设计

    身份重塑:新身份触发主数据、账权、流程、组织系统性重构

    五、未来判断

    以组织身份切入是企业AI落地最佳切入点

    数字员工将从效率工具演变为生产活动参与者

    数字员工将成为toB企业必选项


    听众收益:

    掌握数字员工与传统Agent的六大维度差异框架,能判断企业AI应用是否需要升级为数字员工形态

    了解五大典型场景的落地方式与优先级判断,获得架构设计的模块化参考

    借鉴几百个数字员工上岗的四条实践经验,规避身份重构、安全合规、价值衡量等常见陷阱


    落地挑战和方案重点:

    挑战一:AI赋予正式企业身份触发系统性变革——主数据、账权、流程、组织都需要重构。
    方案:构建数字员工专属账权体系,生命周期管理同正式员工一致,审批从严,token消耗与产出可评测。

    挑战二:数字员工深度接入企业系统,安全风险远高于普通AI应用。
    方案:安全/法务/合规/内容团队从第一天参与设计,多层管控覆盖身份认证、权限隔离与审计,全链路不留盲区。

    挑战三:价值衡量与规模化扩展缺乏依据。
    方案:从具体痛点切入做小场景验证,用可衡量ROI作为扩展决策依据,先确保单点真实价值再规模化。


    嘉宾
    DACon 2026 · 北京站
    董晓庆
    阿里控股企业智能事业部数字员工负责人
    2026-10-23
    14:00 -17:40
    企业模型组合:选型、路由、成本与治理(出品人:Shopee 大模型工程负责人 李超)
    2026-10-23
    14:00-14:45

    为所有人构建开放的统一 KVCache 管理层:LMCache 的开源之路


    演讲介绍

    LMCache 是一个面向大语言模型(LLM)推理的开源 KV 缓存管理层,已加入 PyTorch Foundation,并被 NVIDIA Dynamo、LLM Production Stack、llm-d、KServe 等主流推理基础设施集成。它从设计上就是完全厂商中立的:上层适配 vLLM、SGLang、TensorRT-LLM 等主流推理引擎;硬件覆盖 NVIDIA、AMD、Intel、华为昇腾、摩尔线程、寒武纪等众多加速器;KV cache 的二级(L2)存储后端通过插件方式支持 Mooncake Store、Redis / Valkey、S3 兼容对象存储、NIXL Storage、分布式文件系统以及 GPUDirect Storage;Llama、Qwen、DeepSeek、GPT-OSS、各类 MoE 与多模态模型等几乎所有主流开源模型都开箱可用。

    作为 LMCache 的维护者与核心贡献者,我将在本次分享中讲述「一个开放的 KV 缓存层在实践中究竟意味着什么」。我们会一起回顾 2025–2026 年社区最重要的几个里程碑:加入 PyTorch Foundation;让 MoE 推理吞吐提升最高达 10 倍的多进程(MP)架构重构;让项目真正保持厂商中立的可插拔 L2 存储连接器框架;以及让真实用户敢于上生产的可观测性与健康检查体系。

    更重要的是,我会讲述这一切背后的开源故事:来自 Tencent、Red Hat、NVIDIA、AMD、Intel、IBM、AWS、Google Cloud、Samsung、Cohere、Pinterest、Hugging Face、CoreWeave、Mooncake、Valkey、DDN、VAST、WEKA、昇腾、DaoCloud、Tensormesh、character.ai、Yotta Labs、芝加哥大学等数十家公司与机构的贡献者,是如何协同推进一个高速演进的 AI 基础设施项目的;我们如何保持极低的贡献门槛与新人友好度;以及为什么「开放、中立、双赢合作」不是口号,而是 LLM 时代基础设施唯一可持续的建设方式。


    LMCache 把 KV 缓存从GPU 上的临时产物变成可复用、可持久化、厂商中立的推理基础设施层。本次分享将带你走进这个开源社区——它同时跑在 vLLM / SGLang / TensorRT-LLM 之上,覆盖 NVIDIA / AMD / Intel / 昇腾 / 摩尔线程 / 寒武纪等加速硬件,对接 Mooncake / Redis / S3 / NIXL 等存储——并且始终为新贡献者敞开大门。


    演讲提纲

    一、提出问题:2026 年的 LLM 推理为什么离不开 KV 缓存。并就此介绍:

    二、开放性设计:LMCache 的生态全景 

    三、LMCache 从进程内库到引擎独立服务 

    四、处处可插拔:LMCache 如何坚持厂商中立 

    五、走向生产:可观测性、健康检查与 PD 分离 

    六、背后的开源故事 

    七、Roadmap 与号召 Contribution


    听众收益

    一个真正开放、厂商中立的 KV 缓存层在 2026 年长什么样,以及为什么 LLM 生态需要它。

    LMCache 背后的社区故事:加入 PyTorch Foundation、被 NVIDIA Dynamo / Production Stack / llm-d / KServe 集成、与 vLLM / SGLang / TensorRT-LLM 等主流推理引擎深度协作。

    插件化架构(引擎独立的多进程服务、可插拔 L2 存储连接器、原生连接器)如何在不分裂生态的前提下,支撑多推理引擎、多硬件、多存储后端。

    来自一线贡献者的工程实践:POSIX 共享内存、零拷贝 KV 传输、存储后端的动态发现、可观测性与健康检查体系。

    社区如何保持极低的贡献门槛:新人友好的 issue、透明的设计讨论、跨厂商 CI,以及让协作真正双赢的文化习惯。



    落地挑战和方案重点

    痛点1:架构"破坏性重构"的平滑落地问题 从单进程(与推理引擎"共生死")迁移到推理引擎独立的多进程(MP)服务架构,虽然基于 POSIX 共享内存 + eventfd 的零拷贝方案已经获得极大吞吐提升,但如何在不打破海量下游用户既有部署方式和使用习惯的前提下完成这次重构以支持扩展不同的平台和 Device,目前仍依赖社区逐步验证和过渡适配,没有一次性的完美迁移方案。


    痛点2:厂商中立生态的碎片化与长期治理 LMCache 通过插件化 L2 存储连接器框架 + 动态发现机制,让新硬件(昇腾/摩尔线程/寒武纪等)、新存储厂商(Mooncake/NIXL/S3等)可以低门槛接入,无需侵入主库。但随着接入方数量持续增长,跨厂商 CI 覆盖、接口长期稳定性、以及"不分裂生态"的持续治理,仍是需要长期投入、尚未有一劳永逸解法的问题。

    嘉宾
    DACon 2026 · 北京站
    毛宝龙
    LMCache(PyTorch Ecosystem) 维护者 & 核心架构师
    DACon 2026 · 北京站
    郑春晓
    LMCache(PyTorch Ecosystem) 维护者 & 核心架构师
    2026-10-23
    14:55-15:40

    PPIO的Token工厂与智能模型网关实践

    演讲介绍

    Agent时代Token消耗激增,企业面临上下文浪费、多模型管理混乱、模型选型难等痛点。PPIO模型服务平台与智能模型网关通过模型智能调度、Fusion融合模型等能力,实现智能水平提升与成本降低。本次演讲分享其技术方案与规模化落地路径。


    演讲提纲

    1.PPIO公司简介

    2.Agent时代模型调用痛点
    3.PPIO 智能模型网关:MaaS的“Token调度中心”
    4.PPIO日均2万亿Token调用量背后的技术方案


    听众收益

    听众将获得一套可直接对标自身业务的Agent时代降本增效方法论——理解PPIO MaaS平台如何以智能模型网关统一调度、融合和治理Token,在日均万亿级真实调用实践中实现智能水平提升与成本降低,并带走从高价值场景试点到规模化落地的可复制路径。


    落地挑战和方案重点

    1.模型选型难,智能调度,任务自动匹配最优模型
    2.效果与成本难两全:Fusion融合,用1/10成本达到顶级模型性能;
    3.多模型管理乱:统一 API Key,多模型共用余额,统一账单
    4.Agent Token消耗激增:Prompt Cache(省80%)+推理加速(10倍)
    5.系统集成成本高:OpenAI兼容接口,零代码改造

    嘉宾
    DACon 2026 · 北京站
    李星星
    PPIO 研发副总裁
    2026-10-23
    16:00-16:45

    敦煌网:从"选最强模型"到"做最优组合"——企业模型路由与治理实践

    演讲介绍

    面向企业技术管理,聚焦应用企业在多模型时代的现实选择。讨论如何构建科学的模型组合策略,在能力、成本、速度、安全之间形成系统化平衡,从单点工具升级为系统工程。


    演讲提纲

    1. 开场与问题定义

       - 多模型时代的四大挑战

       - 四维度解决框架(选型、路由、成本、治理)


    2. 多模型组合策略

      - 模型能力矩阵分析

      - 智能任务路由机制

      - API/托管/私有化协同架构


    3. 成本优化与ROI评估

      - 推理成本分析框架

      - 科学ROI评估方法论

     


    4. 统一治理架构

      - 模型治理统一层设计

      - 监控指标体系建设

      - 风险管控机制


    5. 实践案例与总结

      - 典型企业实施案例

      - 分阶段实施路线图

      - 核心要点总结


    听众收益

    战略层面:

    - 建立多模型时代的系统性思维

    - 掌握模型组合的科学决策框架

    - 形成AI投资的ROI评估能力


    技术层面:

    - 获得智能路由的实施方法

    - 学会成本优化的具体技术

    - 了解统一治理的架构设计


    管理层面:

    - 建立模型治理的统一抓手

    - 制定风险管控的标准流程

    - 规划AI能力的演进路线


    方案重点与落地挑战

    方案重点:

    1. 智能路由:基于任务特征自动分配最优模型

    2. 成本控制:建立量化的ROI评估体系

    3. 统一治理:一站式监控、变更、合规管控

    4. 渐进实施:分阶段建设,降低转换风险


    落地挑战:

    1. 技术挑战

      - 任务分类器的准确性

      - 模型性能的实时监控

      - 多供应商API的统一接入


    2. 组织挑战

      - 跨部门协调配合

      - 技术团队能力建设

      - 变更管理的推进阻力


    3. 成本挑战

      - 初期建设投入较高

      - ROI短期内难以量化

      - 多模型并行的成本控制


    4. 风险挑战

      - 供应商依赖风险

      - 数据安全合规要求

      - 服务稳定性保障


    嘉宾
    DACon 2026 · 北京站
    窦东员
    敦煌网 基础架构部总监
    2026-10-23
    16:55-17:40

    GR-Inference:小红书搜索生成式召回性能优化实战

    演讲介绍

    生成式召回正在重塑搜索的召回范式,但它对推理系统提出了前所未有的要求:一次请求携带 1k~5k token 的长上下文,却只解码 3~5 步,同时还要维护 900 条动态扩展的 Beam。通用 LLM Serving 框架对此系统性错位——长 Context 被 Beam 反复复制、共享上下文被一遍遍重算、动态 Beam 与合法 SID 路径约束干脆没有原生支持。我们没有在框架外打补丁,而是与 NVIDIA 联合打造专用推理引擎 GR-Inference:以 Request 为状态归属单位,将 KV Cache 拆分为 ContextKV / BeamKV / BeamPath 三级共享结构,配合稀疏-密集协同的 Decode Attention 和 GPU 常驻 SID Trie 受限生成,把 Beam 状态、动态宽度、约束解码做成 Runtime 一等公民。在 100ms SLA、Beam 900 口径下,吞吐达 SGLang 的 1.5x~2.53x,Item-constrained 场景 3.2x 以上;最终在小红书搜索落地,新增一路自回归 SID 召回通道,离线 Recall@1000 提升 5.7%,有效点击率提升 0.2%,实现耗时达标下的 GPU 高效利用。


    演讲提纲

    一、开场与背景(约 5 min)

    1.1 生成式召回:从“匹配”到“生成”的范式转变
    传统 ANN 双塔召回的先天局限:Query 与笔记独立编码,交互信息未充分参与匹配,召回精度受限于向量相似度的表达上限
    小红书的答案:LLM 生成式 SID 召回——离线分层残差聚类生成多级 SID,在线由 LLM 根据用户 Query 与上下文逐级生成目标笔记的 SID,映射回候选完成召回
    1.2 一个被忽视的推理系统难题
    GR 负载的独特画像:长 Context(1k~5k token)+ 短 Decode(仅 3~5 步)+ 大 Beam(数百条,如 20→300→900 动态扩展)
    为什么通用框架“顺带支持”行不通:Beam Search 不是一等公民,业务侧框架外循环拼装、性能打折

    二、痛点剖析:通用框架的三重错位(约 5 min)
    状态错位:Beam 当独立 Sequence 管理 → 长 Context 复制 N 份,KV 膨胀、带宽浪费
    计算错位:通用 Decode Attention 按行展开 → 900 条 Beam 反复扫描共享 Context
    能力缺失:无原生 Beam Search 路径、无动态 Beam、无 Item-constrained 过滤 → 业务逻辑散落在外

    核心论点:GR 场景需要一个小而专的引擎,把上下文共享、Beam 状态、动态宽度、受限生成表达成 Runtime 的一等公民

    三、GR-Inference 系统设计(约 10 min)

    3.1 设计原则:Request-Centric 状态归属
    以 Request 而非 Beam 作为状态与资源管理的基本单位,分离逻辑状态树与物理存储单元
    五层架构:Serving → Control & Scheduling → GR Runtime → State & Resources → Execution Backend,控制流与数据流分离
    3.2 分离式 KV Cache 三件套
    ContextKV:请求级共享长序列,只存一份,全程只读
    BeamKV:各 Beam 私有短 Decode 历史,Step-major 组织
    BeamPath:分叉拓扑与回溯索引,替代“复制整段 Context”
    效果:Beam 20→900 时只有 BeamKV 与 BeamPath 增长,长 ContextKV 不变
    3.3 调度与执行优化
    Continuous Batching:按“Batch × Active Beam Width”动态组批,批内计算同构
    Beam Width Policy:fixed / scheduled / score-margin 三种宽度策略(分数集中时自动收缩)
    Bucket-based CUDA Graph + 元数据驱动 Replay:静态图 + 动态数据,同一张 Graph 跨请求跨 Step 复用

    四、Kernel 级优化(约 8 min)

    4.1 GR Decode Attention:稀疏-密集协同三级流水线
    K1 密集段:Tensor Core MMA + Split-KV 处理长 ContextKV,最大化存储子系统吞吐
    K2 稀疏段:CUDA Core FMA 处理 BeamKV 的非规则 Gather,规避 Tensor Core 刚性分块约束
    K3 归并段:在线 log-sum-exp 融合两路输出,无需物化完整注意力矩阵
    4.2 GPU SID Trie 与 Constrained Top-K
    传统路径的瓶颈:CPU 查 Trie + 全词表 Mask + host-device 同步开销
    CSR Trie 常驻显存 + 单一融合 Kernel:前缀遍历、合法 Token Gather、局部 Top-K 全在 GPU 完成
    Top-K 范围从全词表缩小到当前 Trie 节点的合法分支

    五、性能评估与工业落地(约 8 min)

    5.1 Benchmark:公平口径下的对比
    测试设置:Qwen3-0.6B BF16,Prefill 100~1000,Decode 3 步,SLA = E2E 延迟 ≤100ms,对比三套 SGLang Beam Search 实现
    固定 Beam 900:吞吐 1.5x~2.53x,且 Context 越长优势越大(与设计目标一致)
    Item-constrained:3.24x~3.63x
    5.2 小红书搜索落地收益
    召回新增一路自回归 SID 通道,耗时达标 + GPU 资源高效利用
    业务指标:点击率 +0.03pt,有效点击率 +0.2%,离线 Recall@1000 +5.7%

    六、总结与展望(约 4 min)

    6.1 一句话总结
    核心洞察:“长 Context 可在请求内共享,各 Beam 仅保留短 Decode 历史”——请求级状态管理、分离式 KV、专用 Decode Attention 与 GPU SID Trie 共同成就端到端性能
    6.2 后续方向
    KV Cache 内存优化:多 Context Bucket + Paged ContextKV
    CUDA Graph 覆盖扩大:Beam Selection 纳入 Graph
    框架扩展:PD 分离、多 GPU 并行、低精度量化、MegaKernel 融合


    听众收益

    1.建立对生成式推荐推理负载的全新认知框架

    理解基于 Semantic ID 的生成式召回为何是“长 Context + 短 Decode + 大 Beam”的独特负载(每请求仅生成 3~5 个 token,却需维护数百条 Beam),以及为什么 vLLM / SGLang 等通用 LLM Serving 框架在这一场景系统性失效——学会从负载特征出发判断“通用框架顺带支持”还是“需要专用引擎”。


    2. 掌握一套面向 Beam Search 的推理系统设计方法论
    深入理解 Request-Centric 状态归属、ContextKV / BeamKV / BeamPath 三级分离式 KV Cache、稀疏-密集协同的 Decode Attention Kernel、GPU 常驻 SID Trie 受限生成等核心设计——这些“上下文共享、Beam 状态、动态宽度、受限生成作为一等公民”的工程抽象,可迁移到任何多分支自回归生成场景(Beam Search、MCTS、Agent 探索等)。


    3. 获得从 Kernel 优化到业务落地的完整实战经验
    看到性能优化的完整闭环:从 CUDA Graph 预捕获、Tensor Core / CUDA Core 异构调度等 Kernel 级手段,到 100ms SLA 下 1.5x~2.5x(Item-constrained 场景 3.2x+)的吞吐收益,再到小红书搜索召回的实际上线效果(Recall@1000 +5.7%、有效点击率 +0.2%)——理解技术优化如何转化为可量化的业务指标,以及工业级 Benchmark 的正确评测口径。


    落地挑战和方案重点

    挑战一:通用 Serving 框架与 GR 负载的系统性错位痛点:业界主流推理框架(vLLM / SGLang / TRT-LLM)的优化目标都是“多用户、长 Decode、单 Beam”的对话形态,Beam Search 不是一等公民。直接搬到生成式召回场景会连环踩坑:同请求的长 Context 被每条 Beam 复制 N 份导致 KV 膨胀;通用 Attention 把 900 条共享上下文的 Beam 当独立行算,反复扫描 Context 造成显存带宽浪费;动态 Beam 与 Item-constrained(合法 SID 路径约束)干脆没有原生支持,业务侧只能在框架外循环调用拼装,逻辑散乱且性能大打折扣。


    方案重点:GR-Inference 以 Request 而非 Beam 作为状态归属的基本单位,将 KV Cache 显式拆分为 ContextKV(请求级共享长序列)、BeamKV(各 Beam 私有短 Decode 历史)、BeamPath(分叉拓扑索引,替代复制整段 Context)三个协作对象;配合“Batch × Active Beam Width”粒度的 Continuous Batching 和按 Bucket 预捕获的 Decode CUDA Graph,让 Beam Width 从 20 扩到 900 时只有 BeamKV 和 BeamPath 增长,长 ContextKV 稳定不变。


    挑战二:受限生成的同步开销与 Kernel 级瓶颈痛点:要保证每步 Decode 落在合法 SID 路径上,传统实现依赖 CPU 逐 Beam 查询 Trie 并构造全词表 Mask,再回 GPU 做全词表 Masked Top-K——host-device 同步开销昂贵且存在大量冗余计算;同时宽 Beam 下共享 Context 被反复读取,GPU 计算效率随 Beam 宽度增加显著下降。


    方案重点:一是 GR Decode Attention 采用稀疏-密集协同三级流水线——Tensor Core MMA + Split-KV 处理密集的 ContextKV,CUDA Core 处理 BeamKV 的非规则 Gather,log-sum-exp 在线归并两部分输出;二是 SID Trie 以 CSR 形式常驻显存,单一融合 Kernel 把前缀遍历、合法 Token Gather、局部 Top-K 全部在 GPU 上完成,Top-K 范围从全词表缩小到当前 Trie 节点的合法分支。最终在 100ms SLA、Beam 900 口径下取得 SGLang 的 1.5x~2.5x 吞吐(Item-constrained 场景 3.2x+),支撑搜索召回通道顺利上线。


    嘉宾
    DACon 2026 · 北京站
    骆兆楷
    小红书 模型工程负责人
    2026-10-23
    14:00 -17:30
    企业语义层建设(出品人:小米 数据中台负责人 勇幸)
    2026-10-23
    14:00-14:45

    从"会查数"到"懂业务"——奇虎360 企业级 Data Agent 的语义层演进与量化评测实践

    演讲介绍:

    奇虎360做了一件挺有意思的事——在公司云数仓整体架构之上,搭了一个能"聊着天就把数据查了"的 AI 应用。一开始的想法很简单:让业务同学不用写 SQL,用自然语言就能取数。但做着做着发现,想让它从"会查数"变成"懂业务",中间隔着一座大山——语义层。大模型写 SQL 这件事,学术数据集上能跑到 85%,一进真实数仓就现原形:几百张表、上万个字段、口径靠口口相传,准确率断崖式下跌,而且错了你都不知道它错在哪。更麻烦的是,业务不可能等你花半年把语义层建好再上线——大多数企业手里就只有散落的表文档和老员工的"这个字段是那个意思"。我们的做法是"半成品冷启动,边跑边长":先用双路径混合路由让系统跑起来——语义完整的走确定性编译引擎,只有表和文档的走 RAG 降级,同时给每一条结果带上置信度分数,用户一看就知道"这条是系统算出来的,那条是系统猜的";然后从薄 API 起步,查数、归因、决策逐层长成 Skill,高频使用的经验再反向沉淀为语义资产;配上三级评测加反馈飞轮,让质量可度量、可回溯。这套方案目前已支撑内部大数据集群运维、S3 、PoleFS 存储运维的指标分析与归因场景,同时、Ops机房运维、文库搜索、会员中台等跨部门业务也已接入使用。语义资产在真实使用中持续自生长——这条路我们已经在走了,来跟大家聊聊踩过的坑和拿到的一手经验。


    演讲提纲:

    一、范式转变:从"模型写 SQL"到"引擎写 SQL"
    1. 学术基准的幻觉:Spider 85% → 真实数仓 50%,差距来自哪里?
    2. 行业共识形成:不确定的归模型,确定的归引擎
    3. 但新问题随之而来:语义层没建完的时候怎么办?

    二、双路径混合路由:语义层不完善时的冷启动方案
    1. AST 主路径:语义层完备时,LLM 仅做意图提取 → 确定性编译器生成 SQL,不走"猜"的路径
    2. Fallback RAG 降级路径:只有表和文档时,混合检索(embedding + 关键词 + 外键图)定位相关表,LLM 兜底生成
    3. 路由决策:PreMatch + 置信度度量 → 自动判定走哪条路径
    4. 置信度的关键价值不止于"准不准"——它决定了哪些场景可以放心用。举个例子:产品运营同学要分析某个功能改版后的留存变化,一条错误的数据可能直接误导产品方向判断。但有了置信度兜底,0.95 以上自动入报表,0.65 以下系统主动提示"这条我不太确定,建议人工确认"——用户心里有数,敢用。反过来看,正是因为有了置信度,这类直接影响业务决策的高敏场景才敢投入生产使用,而不是永远停留在 demo 阶段。

    三、Skill 体系:薄 API → 厚 Skill → 本体元数据
    1. 行业参考:Snowflake Cortex Agent(语义查询 + 非结构化检索 + UDF + Agent Skills 编排)与我们的层面对齐
    2. 渐进路径:暴露指标/维度/枚举查询接口(薄 API)→ 快速构建查数/归因/预测 Skill → 高频经验(归因因子、维度层次、业务阈值)沉淀为本体元数据
    3. 最终形态:Skill 退化为纯编排器,知识全由本体层提供

    四、量化评测:从学术基准到生产落地
    1. 学术基准为什么不够:比 SQL 文本而非查询结果、不涉及业务口径/多轮对话/幻觉检测
    2. 三级评测架构:L1 程序自动比对结果集 → L2 LLM Judge 语义判断 → L3 人工兜底
    3. 数据飞轮:用户点赞经防污染过滤后自动采样为回归测试集,9 维指标持续追踪


    听众收益:

    1. 一套可迁移的渐进式语义层落地方法论:双路径路由让系统先跑起来,RAG + 置信度引导让语义资产在使用中自然生长。
    2. 理解 NL2SQL 学术与生产的鸿沟:WikiSQL / Spider / BIRD 为什么不够用,以及如何搭建面向业务口径的生产级评测体系。
    3. 掌握 Skill 到本体层的演进路径:薄 API → 厚 Skill → 本体元数据的设计取舍与落地经验。
    4. 可复用的三级评测架构:L1 程序 → L2 LLM → L3 人工 + 反馈数据飞轮 + 回归测试。

    嘉宾
    DACon 2026 · 北京站
    郭朝阳
    奇虎360科技 数据开发专家
    2026-10-23
    16:00-16:45

    AI-Native 数据语义平台建设思路

    演讲介绍:

    AI 问数正在逐步成为数据消费的基础能力,但大模型直接回答业务数据问题时,容易出现幻觉、不稳定、不置信等问题。尤其在需要 TEXT2SQL 场景中,单纯依赖模型训练知识或文本召回,很难保证结果准确一致。

      

      语义层的价值,是在大模型和底层数据资产之间增加一层强约束知识。它把指标、维度、实体、业务过程、物理实现、SQL 规则等内容结构化管理起来,让 AI 在明确边界内理解业务、生成 SQL、解释结果。相比单一的文本知识库、RAG 向量召回或全量资产元数据召回,语义层具备更明确的查询约束指导、可解释性、更低的推理消耗,也能同时服务人和 AI 的优势。

      将语义层平台化后,进一步解决口径过期、物理表更新、本地版本不一致、知识分散维护等问题。平台作为统一事实源,持续管理语义定义、版本、映射关系和消费治理,从而提升 AI 问数的准确性、一致性和可信度。


    演讲提纲:

    1. 为什么需要语义平台

    2. 本体和数据语义

    3. 语义平台建设思路

      语义挖掘、语义检索、本体、语义映射、测评体系、MCP、数据治理

    4. 未来方向


    听众收益:

    1. 如何基于数据仓库的数据语义平台建设

    2. 面向数据消费的数据语义建设

    3. dataagent


    落地挑战和方案重点:

    1. 数据准确性
    2. 可持续维护性

    嘉宾
    DACon 2026 · 北京站
    苗治勇
    懂车帝 数据仓库负责人
    2026-10-23
    16:55-17:40

    Apache Ossie 语义层在蚂蚁的落地实践

    演讲介绍

    Data Agent 能写 SQL 却不懂业务,ANT-OSI 以统一语义模型连接平台与智能体。方案以开源 OSI 为基础,采用“基础标准+业务扩展”,由资产平台承载单一语义事实来源,统一模型、血缘与消费出口。落地中,将表、BI 数据模型和查询语句转化为可追溯的人机共建模型;以正向研发链路和血缘监测实现持续保鲜;通过子图检索、置信度及排序优化促进智能体消费。当前已沉淀 100+ 个模型、5000+ 个指标,下一步聚焦语义模型驱动数据研发、模型保鲜以及语义模型在实际业务场景中对端到端准确率的提升。


    演讲提纲

    业务背景:Data Agent 的关键瓶颈已从“生成 SQL”转向“理解业务语义”,语义层是准确、可信、可规模化的基础。

    方案选型:以开源 OSI 为基础,建设 ANT-OSI 统一协议与资产平台承载的 SSOT,实现“一处定义、处处消费”。

    落地进展:已沉淀 100+ 个语义模型、5000+ 个指标;提供面向人、Agent、平台的多场景的消费能力;完成蚂蚁内部多个业务场景的落地。

    落地挑战与解法:针对复杂语义表达、冷启动建模、模型治理、模型保鲜、质量评估、模型消费等挑战,提供以下解法:① 通过“基础标准+扩展标准”满足实际复杂业务的语义诉求;② 基于 AI + 构建方法论提供多源自动化建模方案;③ 通过版本管理、血缘追踪、变更审批、模型巡检等措施来对语义模型进行治理; ④ 从形式化、语义化、下游任务三个层面来评估语义模型的质量;⑤ 通过变更监控 + 模型构建在研发链路的左移来降低保鲜成本;⑥ 通过混合检索 + 渐近披露提升模型在消费场景的性能。

    未来规划:建:推进语义模型驱动的数据研发新范式、优化模型自动保鲜;管:优化质量评分与健康检查;用:增强语义消费的能力,落地更多类型的场景,促进消费闭环。

    总结:语义层不是孤立的元数据能力,而是连接数据资产、治理体系与 AI 应用的可信业务上下文。



    听众收益

    1. 理解为何 Data Agent 必须以统一语义层约束自然语言到数据查询的过程,减少口径不一致与模型幻觉。

    2. 获得企业级语义层建设方法:从统一协议走向构建、保鲜、质量与消费的全生命周期落地路径。

    3. 了解语义层完整的落地实践经验,如:AI 辅助生成降低构建成本,语义模型驱动数据研发、健康巡检降低长期维护成本等。


    落地挑战和方案重点

    复杂业务语义难以被原生标准完整表达:原生 OSI 对多口径指标、多粒度汇总、等价指标口径、公共维度复用、跨模型引用等企业级场景支持有限,直接套用会丢失关键语义。 

    方案重点:以开源 OSI 标准为基础,同时建立可控的扩展标准,支持复杂指标、语义视图、模型组合及 AI 上下文表达


    模型容易随研发和业务变化失效:人工维护成本高,且常处于研发链路之外。

    方案重点是从以下两条链路来实现语义模型的保鲜:

    ● 全链路监测链路:基于反馈、巡检、变更分析的保鲜任务识别。持续检查已有模型,发现变化后给出修改建议,降低日常维护保鲜成本。

    ● 正向研发链路:把语义模型迭代放进数据研发的需求、开发、发布和消费链路中,在研发阶段就校验定义与实现是否一致。


    语义模型消费面临准确率挑战:当模型和指标规模增长后,Agent 或下游平台难以在大量、同名近义且相互关联的语义对象中快速定位正确上下文;全量加载模型也会带来上下文冗余与推理性能问题。

    方案重点:建设“混合检索+渐近披露”消费机制,结合关键词、向量、业务标签和图关系进行召回,支持置信度计算和重排;按任务返回完整可用子图和必要上下文,持续针对取数、端到端研发等场景优化准确率。

    嘉宾
    DACon 2026 · 北京站
    王小军
    蚂蚁集团 蚂蚁数据语义层平台负责人
    2026-10-24
    09:30 -12:05
    生成式推荐系统新范(出品人:小红书 搜索广告算法负责人 王鹤达)
    2026-10-24
    09:30-10:15

    小红书:相关性vs收入不必二选一——Agent重构搜索分发引擎

    演讲介绍

    商业化搜索长期面临一个根本张力:既要"搜得准"(用户体验/相关性),又要"变得现"(商业价值)。传统三段式流水线(召回→相关性→精排)在长尾/模糊query上常常要么给出不相关的结果,要么相关但没商业价值。

    本次分享介绍小红书商业化搜索团队如何用Agent重构搜索分发引擎,从三个结构性瓶颈切入:召回靠固定多路+静态融合覆盖不足、相关性标准靠人肉规则口径漂移、精排靠手工试错迭代慢。团队没有推倒重建,而是在保留现有工业级检索基建的前提下,用三个Agent做增量重构:召回Agent做Agentic检索编排(按query意图动态决策打哪几路、怎么融合)、相关性Agent参与标准设计+大规模自动标注+human-in-the-loop校准(把"人肉标准"变成可规模化复用的资产)、精排走向AutoResearch(让"假设→实验→评估→迭代"闭环自动化)。

    最终实现:Agent不裸跑线上,而是用于离线造标准与数据+在线灰度+人工校准闭环,配套离线评测体系做守门,保证可控与可回退。


    演讲提纲

    一、开场:商业化搜索的根本张力与三处结构性瓶颈

    场景痛点:用户搜"油痘肌 平价 精华"——传统流水线给出不相关贵价大牌或相关但无商业价值的结果

    三处瓶颈:①召回固定多路+静态融合,长尾覆盖不足 ②相关性标准人肉定义、口径漂移 ③精排手工试特征试结构、迭代慢

    二、选型对比:为什么是Agent重构而非推倒重建

    业界三条路线对比:传统级联流水线 vs 端到端生成式 vs Agentic编排

    选型逻辑:保留工业基建,从三个增量切入,风险可控可分段验证

    新命题:如何保证Agent可控与可回退

    三、方案落地:三个Agent的具体实现

    召回Agent——Agentic检索编排:query意图解析→动态改写扩展→决策召回通路与配额→动态融合,每路召回通道都是Agent的tool

    相关性Agent——标准设计+数据标注:把模糊规则结构化成可判定的分级rubric,大规模自动标注+human-in-the-loop校准

    精排走向AutoResearch:Agent自动完成"假设→实验→评估→迭代"闭环,算法同学从"手工试错"转为"定目标、审结果"

    关键工程决策:Agent用于离线造标准与数据+在线灰度+人工校准,不裸跑线上

    四、效果展示

    业界对标:Agentic retrieval/LLM辅助相关性标注/自动化ML研究方向对比

    量化效果:召回相关率/长尾覆盖提升、相关性标注成本↓+一致性↑、搜索相关性GSB提升、商业化核心指标CTR/CVR/收入提升、精排迭代周期缩短

    badcase修复前后对比演示

    踩坑故事:早期Agent自动标注在某垂类出现系统性偏差,用小样本人审+校准闭环拉回一致性

    五、总结:三条带走的方法论

    先用Agent造标准与数据,再谈上线

    保留工业基建,用Agent做编排与调优的"外挂大脑"

    用"离线+灰度+人审"闭环换可控性


    听众收益

    理解商业化搜索中"相关性vs收入"的结构性矛盾,以及Agent重构如何让二者同时抬升——不是理论,是亿级搜索场景的真实落地
    掌握三个Agent的具体设计方法:Agentic检索编排(召回侧)、Agent参与标准设计+自动标注(相关性侧)、AutoResearch闭环(精排侧),可迁移到自己的搜索/推荐系统
    学会"Agent不裸跑线上"的工程化策略:离线造标准与数据+在线灰度+人工校准+离线评测守门,解决"Agent可控与可回退"这一共性焦虑
    获得一条可复用的落地路径:保留现有工业基建,用Agent做增量重构而非推倒重建,风险可控可分段验证


    落地挑战和方案重点

    方案重点:
    Agentic检索编排:召回从"静态多路配置+固定融合权重"变为"按query意图planning",每路召回通道作为Agent的tool动态调度
    标准与数据同源:相关性Agent把模糊规则结构化成可判定的分级rubric,自动标注+human-in-the-loop校准,产出的不是一次性数据而是可复用资产
    AutoResearch闭环:精排从"手工试特征/试结构/调超参"升级为Agent自动完成"假设→实验→评估→迭代",算法同学转为"定目标、审结果"
    可控性设计:Agent主要用于离线造标准与数据+在线灰度+人工校准闭环,不裸跑线上,配套离线评测体系做守门

    落地挑战:
    Agent的可控与可回退:Agent"会思考"不等于"不可预测",需要通过离线评测体系、灰度机制、人工校准闭环来保证可控性,约束太少无法保证交付,约束太多又损害Agent自主性
    自动标注的系统性偏差:早期Agent自动标注在某垂类出现系统性偏差,需要用小样本人审+校准闭环把一致性拉回来——开放业务场景缺少稳定标准答案,Judge也可能漂移
    Agent的成本与延迟:LLM驱动的方案都有耗时和成本问题,需要平衡Agent带来的效果提升与推理成本增加

    嘉宾
    DACon 2026 · 北京站
    王鹤达
    小红书 搜索广告算法负责人
    2026-10-24
    10:25-11:10

    高德路线推荐从工业引擎到大模型Agent的范式跃迁

    演讲介绍

    路线推荐是高德地图的核心能力,每天服务数亿用户。我们构建了行业首个全场景统一路线推荐架构RouteMind,系统性解决非ID化对比、多样性与去冗等难题。随着大模型时代到来,进一步构建路线规划Agent,让系统能够理解自然语言需求,完成复杂出行任务;同时探索TransitLM端到端路线生成,尝试将时空知识直接内化到模型中。本次演讲将分享从工业引擎到Agent,再到端到端时空基座的技术演进路径。


    演讲提纲

    开场:一个自然语言算路需求引发的思考(3min)


    第一幕:理解路——工业引擎如何破解路线推荐的独特难题(8min)

    矛盾A:非ID化对比+多样性质量平衡 → CCN+SCASRec细粒度交叉与生成式去冗

    矛盾B:召排割裂 → GenMRP生成式多路线召回


    第二幕:理解人——Agent如何理解需求并调用工业工具(15min)

    Agent架构设计:速度×质量×迭代速度的平衡

    与工业推荐引擎怎么结合:理解人、调用工具、输出路线与解释

    后训练需要吗:提升领域理解、工具调用和任务编排稳定性

    Benchmark驱动的快速迭代:MobilityBench与可视化评测平台


    第三幕:理解时空——TransitLM端到端生成路线(7min)

    TransitLM:不查地图、直接生成公交路线

    隐式空间定位与路线生成能力涌现

    时空基座模型的未来想象与边界


    总结:三次跃迁的演进逻辑、三个经验takeaway与未来展望(7min)


    听众收益

    1.了解超大规模路网下路线推荐系统的独特挑战,以及从工业引擎到Agent、再到端到端时空基座的技术演进路径和关键决策逻辑

    2. 深入掌握路线规划Agent的设计哲学:如何理解自然语言需求、调用工业推荐工具、在速度与质量之间取舍,并用Benchmark驱动迭代
    3. 理解TransitLM端到端路线生成的核心想象力:模型如何尝试内化时空知识,以及这种方向与生产级Agent的边界和互补关系


    落地挑战和方案重点

    1. Agent速度×质量的平衡**:导航场景要求秒级响应,但Agent调用工具链天然慢。如何在保证速度的同时给出好答案,是生产级Agent的核心挑战。

    2. 从用户反馈驱动到Benchmark驱动的范式转变**:传统推荐以用户反馈(点击、实走、偏航)为效果评估核心,但Agent推荐面临新交互形态(对话、追问、定制),用户反馈信号稀疏且滞后。如何以Benchmark为核心驱动快速迭代,同时建立Agent推荐的用户价值评估体系,是关键挑战。

    3. Agent与工业推荐系统的融合**:Agent擅长语义理解和个性化,工业引擎擅长确定性路线计算。如何让Agent调用工业引擎作为工具而非替代,实现能力互补,是我们实践中摸索出的关键设计原则。

    嘉宾
    DACon 2026 · 北京站
    陈超
    高德 路线推荐核心算法负责人
    2026-10-24
    11:20-12:05

    从隐式推荐到交互式陪伴 —— 推荐系统的智能跃迁

    演讲介绍

    LLM4Rec正在驱动推荐范式的升级,包括几个阶段:
    1. 拆解LLM的MTP技术并赋能传统推荐模块,扩展推荐迭代的边界;
    2. 构建LLM-based的推荐模型,突破传统推荐范式的限制,为系统注入交互与知识推理能力;
    3. 实现新旧推荐范式的融合,迈向交互式推荐, 实现可交互、可推理、可解释的全新推荐体验,并推出了全新的交互式推荐产品:AI伴听。


    演讲提纲

    1.总体介绍:LLM4Rec的技术视图,及赋能推荐系统的三个阶段;

    2. 阶段一:拆解LLM技术,拓展传统推荐的迭代边界:基于MTP构建生成式召回,在TME 10+业务场景取得显著收益,相关工作已被CIKM2026接收;
    3. 阶段二:构建LLM-based的领域推荐模型:通过继续预训练、SFT及RLHF,自研构建MusicRecLLM-8B,为可交互的音乐推荐打下技术基础;
    4. 阶段三:新旧推荐范式融合,构建推荐Agent:能够理解用户的自然语言输入,并驱动推荐全链路进行响应,通过生成式模型及更多的 Scaled Models做超大规模的限制性推荐,并最终结合对用户的完整理解与因果推理,实时生成推荐理由。
    5. 总结与规划:概括回顾以上内容;并展示当前进一步在做的方向,如通过LLM重构对用户lifelong行为的理解。


    听众收益

    1.生成式召回在大规模推荐场景的落地方式;

    2. 通过预训练与后训练,构建LLM-based的推荐领域大模型的方式;
    3. 构建一个可交互、高智能的推荐Agent的方式。


    落地挑战和方案重点

    1. LLM驱动的方案,都有耗时和成本的问题;
    2. 推荐Agent场景下,反馈数据难以归因。


    嘉宾
    DACon 2026 · 北京站
    吴喆
    腾讯音乐娱乐集团 互动视频推荐、创新推荐负责人
    2026-10-24
    09:30 -12:05
    AI Ready到Agent Ready:Data+AI平台架构升级(出品人:数新智能 CEO 陈廷梁)
    2026-10-24
    09:30-10:15

    从"答得对"到"看得透" —— 高德智能问数产品,从BI底座到Agent底座迭代之路

    演讲介绍

    企业数据服务长期困在两个瓶颈:看板永远做不完、长尾需求覆盖不全;而业务真正要的"为什么、怎么办",传统取数只能回答"是多少"。高德智能问数(小豪)没有选择堆更大的模型,而是把沉淀多年的BI底座改造成可路由、可加载领域知识的Agent底座。两个月里我们经历了一次真实的架构迁移:MVP阶段39张表准确率89.4%,全量扩到331张表时端到端准确率一度暴跌到50%,最终从RAG+Workflow切换到Skill架构才回升到95%。本次分享按Gartner L2→L3→L4坐标,复盘这条从"数据问答"走向"洞察生成"的迭代路径、架构决策、踩过的坑。


    演讲提纲

    一、业务背景:看板做不完,且"拿到数≠拿到洞察";Gartner L0-L4坐标

    二、方案选型:为什么是"改造BI底座为Agent底座"而非接更大模型;A+B双引擎;核心是语义层建模

    三、落地过程:MVP(89.4%)→ RAG全量(暴跌50%)→ Skill架构(95%)

    四、解决思路:AI-Friendly知识库三类知识来源(元数据自动/业务知识人喂/路由规则);评测飞轮三件套

    五、业界案例与成效:字节/美团NL2SQL 95%、OpenAI 6层context对标

    六、落地挑战与未来规划:L3洞察可信度/用户信任/信息损失

    七、总结:底座决定上限,从"答得对"到"看得透"才刚上路


    听众收益

    1. 如何把已有数仓/BI资产改造成Agent可消费的底座,而非推倒重建

    2. 一次真实的架构迁移全过程——RAG为何撑不住、Skill架构为何成为出路(89.4%→50%→95%)

    3. data agent落地的真正难点在语义层与评测体系这两块"脏活"

    4. 对"数据问答→洞察生成(L2→L3)"方向的判断与开放挑战


    落地挑战和方案重点

    最大挑战出现在规模化:单领域 MVP 表现很好(89.4%),但一旦全量扩表,RAG+Workflow 架构的本质缺陷暴露——一次性知识召回、多步信息损失、不支持跨表复杂计算,导致端到端准确率暴跌到 50%。方案重点是架构层从 RAG+Workflow 切换到 Skill(渐进式披露)架构,用按需召回 + AI 自反思纠错,把准确率拉回 95%,同时在agent框架下通过skill,实现用户深度/延展的用数场景的可控性与扩展性。

    嘉宾
    DACon 2026 · 北京站
    林宇航
    高德商业智能部 数据产品专家
    2026-10-24
    10:25-11:10

    从多云底座到 AgentReady:企业 DataAgent 架构升级与高端零售行业落地实践

    演讲介绍:

    大模型正从单点 Copilot 演进为 Agent 智能范式,但企业的数据散落在多云多品牌之间,合规约束严苛,碎片化 AI 应用各自为战,Agent 上了线也"无数据可用"。本次双人分享由某全球头部高端零售厂商与数新智能CTO联合呈现:上篇从业务视角拆解高端零售全球化多云数据管理的真实痛点——数据孤岛、合规壁垒、碎片化 AI 的局限,以及对 Agent-Ready 数据底座的核心诉求;下篇从技术视角输出解法——多云 AI 原生平台之上的 DataAgent 整体架构、企业语义层构建、沙箱安全防护与闭环迭代体系,并详解高端零售行业落地的工程难点与解法。


    演讲提纲:

    上篇|某全球头部高端零售厂商 CTO(行业实践视角)

    高端零售全球化数智化转型行业背景:多品牌布局、全球数千零售网点,传统人工驱动的数据运营模式的瓶颈。

    企业多云多架构下的数据核心痛点:数据孤岛、经验决策效率低,高端零售行业极高的数据安全、隐私合规约束。

    行业 AI + 数据智能化转型实践与探索:门店优化、用户运营、需求预测、防伪溯源等场景落地,点明碎片化 AI 应用的局限。

    业务侧对 AgentReady 数据底座的核心诉求:多环境适配、安全防护、语义理解、可迭代的企业级 DataAgent 能力。


    下篇|数新智能 CTO(技术视角)

    DataAgent 架构升级核心背景:承接高端零售业务痛点,结合全球化项目落地经验,剖析企业多云异构环境下的共性技术难题。

    数新一站式 DataAgent 整体架构设计:构建一站式多云数智底座、企业专属语义层,依托项目实践完成全链路 DataAgent 架构整体设计。

    核心工程挑战与落地解决方案:Skills 技能生态、上下文工程、沙箱安全防护、闭环迭代体系四大核心能力,支撑中企出海及全球企业入华等复杂业务落地。

    企业落地核心难点专项解法:多版本兼容容错、业务知识库补齐治理方案,解决全球化企业落地核心痛点。

    架构升级的效果衡量:端到端的数据交付效率整体提升70%左右;Agent任务诊断准确率提升50%,通过语义知识库的建设,代码生成准确率从30%提升到90%。

    总结与未来展望:沉淀项目实战经验,拓展Agent多模态应用能力。


    听众收益:

    1.业务视角:了解高端零售全球化企业多云数智转型真实痛点,掌握高端行业建设 AgentReady 数据底座的业务诉求与建设门槛。
    2.技术视角:掌握 Harness 范式企业 DataAgent 完整架构设计,学习沙箱、细粒度权限管控等高合规行业安全落地策略。
    3.工程实践:学习 Apache Ossie 本体规范、CodeWiki 语义增强方法论,补齐企业元数据短板,提升 Agent 业务理解与执行准确率。


    落地挑战和方案重点:

    1.多云异构环境下 DataAgent 高可用适配:企业多版本、多场景环境复杂,依靠动态技能注册、异常降级自愈,解决 Agent 适配容错难题,保障复杂异构环境稳定运行。
    2.企业元数据、业务知识库残缺:业务资料零散,依托 CodeWiki 自动化语义抽取,联动业务建立长期治理闭环,持续提升 Agent 对业务理解的精准度。

    嘉宾
    DACon 2026 · 北京站
    谈总
    某全球头部奢侈品厂商 大数据负责人
    DACon 2026 · 北京站
    原攀峰
    数新智能 CTO
    2026-10-24
    11:20-12:05

    OPPO:从存算分离到Agent数据底座——Curvine的端云协同架构实践


    演讲介绍:

    Curvine(曲率引擎)是面向 AI 原生与云原生工作负载的高性能分布式缓存文件系统——在多云对象存储之上叠加 POSIX 文件语义 + 多级分布式缓存,为大规模 AI 训练/推理、AI Agent 平台、大数据存算分离与多云迁移,提供统一、低延迟、可治理的端云协同数据访问层。


    演讲提纲:

    1、云端弹性Agent的数据痛点

    2、业界已有方案分析

    3、Curvine在Agent端云协同场景技术方案

    4、Curvine在AI其他场景案例

    5、Curvine的性能效果数据

    6、未来展望


    听众收益:

    1、了解Curvine技术特点,体验云上大规模Agent技术需要特点

    2、接触前沿AI场景下对数据基建的技术演进动向


    落地挑战和方案重点:

    1、Curvine在AI训练场景下数据加速应用

    2、Curvine在AI推理多层KVCache扩展应用

    3、Curvine在端云Agent沙箱场景应用

    4、Curvine在多云场景解决带宽瓶颈落地


    嘉宾
    DACon 2026 · 北京站
    付庆午
    OPPO 数据平台部大数据架构师
    2026-10-24
    09:30 -12:05
    Agent 评测工程:从度量到改进的闭环
    2026-10-24
    09:30-10:15

    从TDD到EDD:评测驱动的Data Agent开发范式

    演讲介绍

    数仓智能问数Agent落地后,"答得对不对"长期靠人工抽检,实验室题单一、口径漂移不可感知。我们自建"建—管—CI—归因"四阶段流水线,以任务完成度45%为核心权重构建评分体系:基于线上真实问题构建4大业务方向千题级评测集,14天滚动更新;以聚合守恒、场景路由、SQL一致性细化单一EX判定;并行调度+答案隔离实现无人值守评测CI。题库已生产可用,人力成本消耗降低约30%。


    演讲提纲

    一、业务背景:评测是Data Agent的"信任基础设施"——三大痛点:人工抽检不可持续、实验室题单一、口径变更不可感知

    二、方案选型:为什么不直接用BIRD/Spider——三点不适配。自建"建—管—CI—归因"四阶段流水线。四维评分体系(任务完成度45%/推理规划25%/工程效率15%/安全鲁棒15%)

    三、落地挑战:答案可信与防泄露、判定粒度、千题级评测耗时、评测集时效

    四、解决思路:建(千题级评测集/1000题入库);管(14天滚动更新+版本快照+口径变更感知);CI(无人值守/并行调度/答案隔离,24h→12h人力降30%);归因(聚合守恒/路由命中率/SQL一致性/反哺Skill);安全鲁棒(提示词→确定性软件拦截/前置准入校验→物理隔离→权限隔离)

    五、未来规划:看板化、知识化、硬隔离

    六、总结:①评测是迭代基础设施;②真实问题+滚动更新对抗口径漂移;③判定细到"为什么错"


    听众收益

    1. 认知升级:看清企业级评测与学术基准的本质差异——四维评分框架及权重设计

    2. 工程方法:一套可落地的"建—管—CI—归因"评测流水线——千题级评测集/14天滚动更新/无人值守CI

    3. 判定经验:让评测从"打分"升级为"改进"——聚合守恒/路由命中率/SQL一致性等细粒度判定


    落地挑战和方案重点

    痛点 1:评测器自身的可信度——"谁来评测'评测'"

    标准答案基线会随口径演进悄悄失效(std_sql 过期、单实体答案覆盖不了多实体问题),机器判定也存在误杀(如聚合粒度不一致被判错、守恒等价未纳入判定出口)。目前仍需人工抽检兜底误判归因,"Skill 真实错误率"与"评测不可判率"如何干净分离、基线健康度如何低成本持续保鲜,尚无完美解法。痛点 2:从"发现错误"到"修复错误"的闭环尚未打通

    评测能量化准确率、定位口径错误,但归因仍依赖人工逐题看报告;口径知识散落在个人经验中,无法自动沉淀为结构化指标知识反哺 Skill 生成。"评测→知识→准确率提升"的双向反馈是我们正在攻坚的下一阶段命题,欢迎有同类实践的团队交流。


    嘉宾
    DACon 2026 · 北京站
    荣柯柯
    高德商业智能部 数据技术专家
    2026-10-24
    10:25-11:10

    构建高交付质量的垂类AI Agent:业务真实的Benchmark做部署时对齐,兑现率做成工程对象

    演讲介绍:

    MiraDay 是招聘领域的垂类 Agent。我们发现交付质量的瓶颈不在模型能力,而在兑现率。大家的能力上限在快速趋同,兑现率才是垂类 Agent 的主战场。为此我们构建MiraBench 做部署时对齐(deployment-time alignment);并把“停止”作为兑现率最大的单一损失源,在 Harness 层进行了专项处理。重构后 MiraBench 综合分从 40.1 提升至 75.2


    演讲提纲:

    1、背景与痛点
    2、思考与解决方案
    3、收益与表现
    4、未来展望


    听众收益:

    1.理解垂类 Agent 的“交付质量”不能只看任务是否跑完,需要从稳定运行、任务完成、交付正确,一直追踪到用户采纳和业务结果。

    2. 掌握一套从真实业务构建 Agent Benchmark 的方法:以业务任务为主轴,加入能力探针和分层判定,再从评估结果回到 Trace 定位理解、规划、执行、验证和停止问题。
    3. 了解如何通过 Harness 管理 Agent 的运行时行为,特别是利用外部证据校准 continue / ask / commit,减少早停、空转、过度执行和错误交付。


    落地挑战和方案重点

    1. 开放业务场景缺少稳定标准答案,Judge 也可能发生漂移。需要组合使用确定性断言、业务约束、模型判定和真实用户行为,并持续用人工金标校准。
     2. Harness 的边界很难把握:约束太少无法保证交付,约束太多又会损害 Agent 的自主性。实践中需要将硬约束、证据验证、预算控制和停止判断分层设计,而不是把所有规则都塞进 Prompt。

    嘉宾
    DACon 2026 · 北京站
    王旭
    科锐国际 高级专家兼MiraDay 技术负责人
    2026-10-24
    11:20-12:05

    Agent 评测如何落地:可信标准与双 Loop 演进实践

    演讲介绍:

    随着大模型和 Agent 框架逐渐成熟,Agent 的搭建门槛不断降低,但要真正进入业务并实现规模化应用,仍需解决效果判断、问题定位和版本回归等难题。本次分享将结合美团在 AI Agent 评测平台建设及业务落地中的实践,介绍 Agent 评测与传统模型评测的差异,以及如何建立可信的评测标准,通过“人人一致、人机一致”提升评测的准确性和规模化能力,并借助 Agent 迭代与评测体系迭代的“双 Loop”,持续发现问题、定位原因并驱动优化。


    演讲提纲:

    1. 业务背景:为什么 Agent 落地需要新的评测体系
    随着基座模型、Agent 框架和工具协议不断成熟,搭建一个 Agent 越来越容易,但将其稳定推向真实业务和规模化应用仍然很难。真实环境中的 Agent 由模型、Prompt、规划、知识、记忆、Tool/Skill 和工程流程共同构成,任何一个环节的问题都可能沿执行链传递,最终表现为难以理解、难以复现的异常。
    本部分将通过真实案例说明:只看最终回复,往往无法判断任务是否真正完成,也无法定位问题发生在哪一步。因此,Agent 评测不仅要回答“效果好不好”,还要回答“哪里好、哪里不好”,成为支撑研发、回归、上线和持续优化的“精密量具”。

    2. 方案选型:Agent 评测应该测什么、怎么测
    Agent 评测需要从单一的答案打分,转向对任务结果、执行过程、效率和风险的综合判断,既看最终 Response,也看完整 Trace/Trajectory。
    在评测方法上,根据问题性质组合使用多种方案:
    - 客观评测与主观评测并行:对事实、状态和明确约束采用规则、代码或数据核验;对语义质量和整体体验采用人工或 LLM-as-a-Judge,按照 Rubric 判断。
    - 端到端评测与过程评测结合:端到端评测判断用户任务是否完成,过程评测沿规划、Skill、知识和工具调用定位问题。
    - 离线评测与在线评测结合:离线回测守住评测集已经覆盖的已知场景,在线评测、监控和巡检持续发现真实流量中的未知问题。
    评测体系的核心不是堆叠指标,而是在模型能力、Agent 能力、任务目标和业务目标之间建立可解释的连接。

    3. 落地挑战:评测体系建设中的关键难点
    第一,Agent 执行链路复杂。最终回复成功不等于任务真正成功,如果缺少完整观测数据,就无法复现现场和定位根因。
    第二,主观标准容易漂移。产品、运营、研发和 QA 可能使用不同尺度判断同一个样本,导致版本指标变化无法解释。
    第三,机器评测不一定可信。LLM Judge 只有稳定复现经过校准的人工判断,才能用于规模化评测。
    第四,离线评测存在天然覆盖边界。固定评测集只能验证已知场景,无法自动发现新的用户需求、行为分布变化和未知问题。
    第五,Bad Case 只能说明“这里出了问题”,如果缺少沿 Trace 的归因机制,就无法判断应该修改 Agent,还是应该校准 Rubric、Judge 或评测集。

    4. 解决思路:构建可信并持续演进的评测闭环
    首先,建设“最小可归因”的观测能力,记录完整的模型输入输出、Tool/Skill 调用、执行状态和任务结果,为过程评测与问题归因提供基础。
    其次,通过“人人一致、人机一致”建立可信标准:
    - 设置明确的质量口径负责人,联合业务专家定义“什么叫好”。
    - 采用背靠背标注发现分歧,将模糊标准下钻为可观察、可执行的 Rubric。
    - 使用校准后的人工结果验证机器评测,使 Judge 能够规模化复现人工标准。
    再次,建立由“四个模块、三种能力、两个 Loop、一套资产”组成的完整体系:
    - 四个模块:离线评测、在线评测与监控、Case 挖掘与归因、观测基建。
    - 三种能力:发现问题、定位问题、驱动演进。
    - 两个 Loop:一个 Loop 改进 Agent,一个 Loop 校准评测体系。
    - 一套资产:持续版本化的端到端与过程评测集。
    最后,通过真实 Case 将两条 Loop 连接起来:线上发现问题,Case 池沉淀样本,沿 Trace 完成根因分析;Agent 问题进入修复、离线回测和上线验证,评测问题进入 Rubric、Judge、标签及评测集校准。

    5. 未来规划:从最小闭环走向规模化与自进化
    Agent 评测体系不应一次性追求“大而全”,而应根据业务阶段渐进建设:
    - 冷启动阶段:优先建立完整 Trace、端到端种子评测集和基础回测门禁,形成最小闭环。
    - 扩量阶段:完善分层评测集、过程评测、在线巡检和 Case 池,提高问题发现与定位效率。
    - 规模化阶段:持续提升人机一致性,将评测自动嵌入研发和发布流程,实现评测集版本化、线上 Case 自动回流、机器辅助归因及自动化门禁。
    - 持续运营阶段:通过真实业务数据不断发现评测盲区,使 Agent 能力与评测体系共同进化。

    6. 总结:一套成熟评测体系的四个核心认识
      - 评测是衡量 Agent 效果的“精密量具”。
      - 人人一致让标准可信,人机一致让评测规模化。
      - Agent 评测是一门实践科学,需要从真实 Case 中持续生长。
      - 一个 Loop 改进 Agent,一个 Loop 校准评测;Case 负责连接,评测集沉淀共同资产。
    本次分享最终希望帮助听众建立一套可执行的 Agent 评测建设路径:从看见问题、统一标准开始,逐步形成能够发现问题、定位问题并持续驱动业务演进的工程闭环。


    听众收益:

    1.建立完整的 Agent 评测认知:理解 Agent 评测与传统模型评测的差异,掌握从结果、过程、效率和风险等维度评价 Agent 的基本框架。


    2. 掌握可落地的评测体系建设方法:学习如何通过“人人一致、人机一致”建立可信标准,并结合离线评测、在线评测、Case 归因和观测基建形成工程闭环。

    3. 获得分阶段建设与避坑经验:能够根据业务所处阶段识别评测体系短板,从最小可用闭环起步,逐步建设“双 Loop”机制,持续推动 Agent 与评测体系共同演进。


    落地挑战和方案重点:

    1. 主观评测标准难统一、机器评测结果难以直接信任。不同角色对同一样本可能产生不同判断,LLM Judge 也可能随模型、Prompt 和样本分布变化发生漂移。方案重点是先通过标准责任人、背靠背标注和可执行 Rubric 实现“人人一致”,再持续抽样复核和校准 Judge,实现“人机一致”。这一过程仍需要业务专家和人工标注投入,无法一次建设后永久有效。

    2. 离线评测只能覆盖已知场景,难以及时发现真实流量中的新问题。固定评测集适合版本回归和发布门控,但无法验证尚未进入评测集的新需求。方案重点是结合在线评测、监控巡检和 Case 挖掘发现未知问题,再沿 Trace 完成归因并回流评测集。其挑战在于需要较完整的观测基建,同时要平衡覆盖率、发现时效与评测成本。

    嘉宾
    DACon 2026 · 北京站
    高诗梦
    美团 专家工程师
    2026-10-24
    09:30 -12:05
    模型适配与效果优化——从 Harness 到后训练(出品人:润和软件 首席科学家 徐立扬)
    2026-10-24
    09:30-10:15

    给模型立规矩:业务 Agent 的三重约束——角色 · 知识 · 动作(以营销策略 Agent 与数据分析 Agent 为例)

    演讲介绍

    当前企业 AI 改造的常见误区,是把旧系统加一个对话入口当作完成升级:模型可以生成自然语言,但没有业务身位、不掌握企业专属口径,也无法在执行前拦截副作用,导致输出「可用但不可信」。通用 Agent 与业务 Agent 的本质差异不在模型能力,而在约束层:通用 Agent的判断标准内嵌于执行环境(可编译、可运行即算通过),且以沙箱为默认收口;业务 Agent 的判断标准落在企业规则、口径与合规红线上,需在执行前完成确定性校验。为此我们把 Harness 抽象为三道约束——角色约束(系统提示层固化身份与拒绝边界)、知识约束(业务图 / 指标库 / 案例库 / 文案库,按需检索)、动作约束(业务原语 + 资源 / 权限 / 端口 / 比例 / 时间的确定性校验)。已在 chatMA(营销策略 Agent)与 JoyAnalysis(数据分析 Agent)落地:将业务目标转化为可校验、可回放、带血缘的产物流。


    演讲提纲

    1.业务背景:旧软件接入 AI 往往只是增加一个输入框。营销人员知道要做召回却配不出画布,经营人员知道要看产值却不会找表写 SQL——缺的不是入口,而是把业务目标翻译成可执行动作的过程。

    2.方案选型:为什么通用 Agent(codex、workbuddy 一类)扛不动业务?它没有企业身位、没有专属资产、不承担副作用。解决方式不是换更强的模型,而是在同一通用运行时之上,由业务侧补一层约束,即三道约束:立角色、喂知识、限动作。

    3.落地挑战:隐性知识显性化,把资深员工脑子里的规则、口径、踩坑经验沉淀为可检索资产;以及生成式与验证式的划界,让越靠近副作用(发送、发布、写入)的步骤越由代码收口。

    4.解决思路:角色约束落地为角色宪章,定义它是谁、如何判断、何时拒绝,并注入提示词栈;知识约束落地为业务资产能力化,包括业务图、指标库、案例库、文案库,以检索即服务的方式供给;动作约束落地为业务原语加确定性校验,对资源、权限、端口、比例、时间逐项把关,缺一阻断,由代码收口。两个案例分别演示三道约束如何装进运行时:chatMA 演示从业务需求到可编辑策略的全过程,JoyAnalysis 演示只读查询、权限控制与证据闭环。

    5.未来规划:把三道约束沉淀为可复制的企业落地路线,依次是立三道约束、接入 Agent loop、回到产品闭环,并逐步扩展到更多业务闭环。

    6.总结:企业不必重写所有旧软件,只需找到最有价值的业务闭环,用三道约束把它约束成模型可参与、代码可约束、用户可信任的 Harness。


    听众收益

    得到一套可迁移的框架:用“角色 · 知识 · 动作”三道约束,判断自己的业务该在哪约束模型、约束什么,而不是笼统地“上个 Agent”。
    看清通用 Agent 与业务 Agent 的边界:理解同一模型 + 通用运行时之上,业务侧究竟要补哪三层适配,从此能回答“为什么通用 Agent 直接用不了”。
    带走可直接上手的模板:业务闭环画布、角色宪章模板、业务资产卡片三份脚手架,听完就能梳理自己的业务闭环。


    落地挑战和方案重点

    1.隐性知识的显性化仍是最大成本。角色宪章、业务图、指标库依赖对资深员工经验的一手抽取,初期投入重、见效慢;一旦停在“模型答得像不像人话”的评估层面,就很容易低估这块工作量。方案重点:先用业务闭环画布锁定一段高价值闭环,小切口把资产盘点做扎实,再用复用率、越权拦截率等指标证明价值。
    2.“生成式”与“验证式”的边界需要业务与技术共同定义。哪些动作可以交给模型自由提出候选、哪些必须在副作用前硬校验(资源 / 权限 / 端口 / 比例 / 时间),边界定松了会出事、定紧了会丧失灵活性。方案重点:以“副作用梯度”为原则——越靠近发送、发布、写入,越从生成式转为验证式,并由代码收口。


    嘉宾
    DACon 2026 · 北京站
    孟垂实
    京东科技集团 算法总监
    2026-10-24
    10:25-11:10

    从 Harness 到后训练:以 GUI 测试执行 Agent 为例的领域agent优化实践

    演讲介绍:

    以 GUI 自动化测试执行为切入点,拆解大模型在垂直业务中 "从能用变好用" 的完整适配路径 —— 什么时候靠 Harness Engineering 就够了,什么时候必须上后训练,以及两者如何协同。
    大模型落地企业业务的核心命题,不是 "模型够不够强",而是 "模型在具体场景里够不够稳、够不够准"。围3绕这一命题,业界形成了三条技术路径:Harness Engineering(框架侧控制)、RAG/Prompt(知识注入)、后训练(模型侧固化)。三者各有边界,但在真实项目中往往需要组合使用、动态取舍。
    本次分享以基于大模型的 GUI 测试执行 Agent 为贯穿案例,系统讲述我们在实践中的思考与踩坑:
    Part 1 聚焦 Harness Engineering—— 从 Agent 的本质出发,梳理框架侧可干预的 10 个关键节点,重点拆解上下文工程的场景适配方法,以及 Tool Calling 的管理与兜底机制,回答 "什么时候框架侧就够了"。
    Part 2 进入后训练 —— 介绍后训练的整体范式,结合测试执行场景分析哪些问题适合通过后训练解决、如何构建高质量数据集、训练机制如何设计,并对效果进行实证探讨。
    最终目标是给出一套可复用的选型决策框架:面对一个具体业务场景,如何判断该投 Harness 还是投训练,如何分配工程资源,如何用评测闭环驱动持续优化。


    演讲提纲:

    part 1 

    如何通过Harness Engineering优化领域agent
    1.agent的本质

    2.harness干预的10个节点
    3.上下文工程与场景适配
    4.Tool Calling Management与兜底

    part 2

    模型后训练与agent优化

    1.后训练整体范式
    2.以测试执行为例哪些场景适合后训练
    3.以测试执行为例如何构建数据集
    4.以测试执行为例训练机制与效果探讨


    听众收益:

    1 一套选型判断框架 拿到一个 Agent 场景,能快速判断 "Harness 够不够、要不要上后训练",避免盲目投入训练资源
    2 Harness 干预的 10 个节点清单 从上下文、工具调用到兜底策略,覆盖框架侧优化的完整操作面,可直接对照自查
    3 GUI 测试执行的实战经验 一个真实垂直 Agent 从 0 到 1 的优化路径,包括踩坑点和解决方案
    4 后训练数据集构建方法论 针对 Agent 类任务,如何采集、清洗、标注训练数据,保证数据质量与场景覆盖
    5 评测驱动的优化闭环 如何建立 Agent 框架 + 评测反馈循环,用数据而非直觉驱动效果迭代


    落地挑战和方案重点:

    核心挑战
    边界模糊:Harness 能解决的问题和必须靠训练解决的问题,在项目初期往往难以区分,导致要么过度训练(成本高、迭代慢),要么框架补丁越堆越多(维护灾难)。
    Harness 复杂度失控:上下文拼装、工具路由、异常兜底层层叠加,系统变得不可解释、不可维护。
    后训练数据稀缺:Agent 执行类任务的高质量标注数据获取成本高,且分布长尾严重。
    效果评估困难:GUI 测试执行的 "正确性" 涉及多步推理与视觉理解,传统单轮评测指标不适用。

    方案重点
    边界模糊   建立决策矩阵:按问题类型(知识缺失 vs 能力缺失 vs 稳定性缺失)匹配适配手段;先 Harness 验证可行性,再决定是否后训练固化
    Harness 复杂度 梳理10 个干预节点,将上下文工程、Tool Calling 管理、兜底策略模块化、可配置化,避免硬编码补丁
    数据稀缺  采用人机协同 + 轨迹回放构建数据集:从真实执行轨迹中挖掘正负样本,结合规则自动标注 + 人工抽检
    评估困难  构建多步任务评测集,以端到端任务成功率为核心指标,辅以单步准确率、重试次数、耗时等过程指标


    嘉宾
    DACon 2026 · 北京站
    詹伶俐
    江苏润和软件股份有限公司 技术专家
    2026-10-24
    09:30 -12:05
    AI 驱动的客户全旅程:从营销获客到客服服务(出品人:小赢科技 模型应用开发负责人 武文斌)
    2026-10-24
    09:30-10:15

    从外购到自研,从向量RAG到Agentic语音智能体——企业对话机器人的完整演进之路

    演讲介绍:

    公司采用外购第三方机器人方案,存在定制困难、长期调用成本高、业务流程难以深度打通等问题。团队启动自研路线,依次完成向量知识库、大模型对话、传统 SOP 流程机器人建设,并演进至 Agentic 智能语音机器人。落地中攻克实时语音链路时延、Agent 流程失控、知识库幻觉等难题,构建分层记忆与任务调度体系。上线后人机对话完成率显著提升,长期服务成本下降,形成一套可复用的企业智能机器人迭代建设路径。


    演讲提纲:

    一、业务背景:外购语音机器人痛点,自研转型动因

    二、方案演进与选型复盘

    阶段 1:第三方外购平台试用与局限性总结

    阶段 2:向量知识库 + RAG 基础对话能力搭建

    阶段 3:大模型接入、标准化 SOP 流程机器人落地

    阶段 4:升级 Agentic 架构,实现自主任务规划语音机器人

    三、落地核心挑战梳理

    四、关键解决思路与架构设计(记忆体系、任务调度、语音端到端协同)

    五、上线效果与数据复盘

    六、未来规划:多智能体协同、持续降低推理成本、自动化评测体系建设


    听众收益:

    1.掌握对话机器人外购 vs 自研的选型判断标准,理清不同阶段技术投入边界;

    2.学习从向量 RAG、SOP 机器人向 Agentic 语音智能体平滑演进的工程实施路径;

    3.获取线上生产环境中大模型语音交互、Agent 任务调度、知识库幻觉治理实战方案。


    落地挑战和方案重点:

    1.Agent 任务执行不确定性:复杂业务流程下智能体易偏离标准 SOP,出现流程跳跃、幻觉输出;重点方案:软硬规则双层约束、任务状态持久化、多轮行为校验机制。

    2.语音链路 + 大模型联合推理时延压力:音频流处理、向量检索、LLM 串行调用造成响应超时;重点方案:模块异步解耦、热点知识库预缓存、分级推理策略优化。


    嘉宾
    DACon 2026 · 北京站
    武文斌
    小赢科技 模型应用开发负责人
    2026-10-24
    10:25-11:10

    高德营销补贴ROI评估:从人工一次性到可信决策引擎

    演讲介绍:

    营销补贴花得值不值,本质是个因果问题:补贴带来了多少增量订单。难点在于反事实不可观测——没有"不发补贴会怎样"的对照,连算得对不对都无法直接检验。而大模型的本能是"总能给个答案",放进这种没有标准答案的场景,反而是风险。

    我们在做的,是把过去一次性、靠人工的因果评估,变成一个每天能批量跑、结论可复现、可审计的评估引擎。重点不在"算得更准",而在让系统知道哪些活动自己没资格下结论,上线以来支撑了多个业务场景的营销评估。


    演讲提纲:

    一、业务背景:营销补贴ROI为什么是"没有真值的决策"

    二、方法选型:因果方法不是单选,而是一条按数据条件降级的路由,厘清AI在这里的能力边界

    三、落地挑战:口径污染、活动重叠、小样本匹配等典型问题

    四、解决思路:用工程手段锁住可复现,再用一套分层校验,逐层兜住上述问题

    五、未来规划:让方法选择更自动、把评估经验沉淀复用

    六、总结:没有ground truth的决策系统,工程重心从"追求更准"转向"管理系统对自身正确性的认知"


    听众收益:

    一套判断AI在系统里该放哪一层的可复用判据

    无真值场景下的可信度工程方法

    三个真实案例复盘


    落地挑战和方案重点:

    规模化与自证的张力:引擎能日跑大量活动,但可信度分级仍依赖部分人工阈值,如何让系统自动、可靠地判定结论是否成立,仍是开放问题。


    无真值下的方法排序:多个方法结论不一致时,业界还没有公认的离线择优标准。我们用多方法交叉验证 + 人工裁决守住结论的可靠性,并在把这套裁决经验沉淀为可自动化的仲裁机制。


    嘉宾
    DACon 2026 · 北京站
    许晓巍
    高德 数据技术高级专家
    2026-10-24
    11:20-12:05

    从对话式问数到组织级数据工作空间:京东广告数据分析 Agent 的工程化实践

    演讲介绍:

    自然语言问数让业务用户可以聊着天查数据,但在广告经营分析这样的真实场景中,一次性回答远远不够。业务更需要可复现的分析过程、可追溯的数据口径、可持续生成的报告模板,以及能被多人、多入口、多 Agent 复用的组织资产。本次分享将结合京东广告数据分析 Agent 的核心设计与开发实践,介绍我们如何以 Graph 承载查数、计算、出图、报告和归因执行过程,并将 Query、Dataset、Report、Template、Execution 和 Provenance 轻量沉淀为数据工作空间,探索 Data Agent 从个人提效工具走向组织级数据工作资产的工程路径。


    演讲提纲:

    一、背景:为什么对话式问数不等于生产级 Data Agent

    1. 京东广告经营分析的复杂性:指标多、口径细、维度深、报告频繁、异常归因链路长。
    2. 早期对话式 Agent 的价值与边界:能回答问题,但难以复现、复用、协作和审计。
    3. 从个人效率到组织效率:一次成功分析不能只留在对话里。
    4. AI-Ready 之后的新问题:AI 做完后,组织到底留下什么?

    二、核心判断:Graph-first, Workspace-light

    1. Graph 是动词,Workspace 是名词:一次分析执行过程与执行结果的分工。
    2. 为什么不直接重做完整 Workspace:平台重投入风险与真实买单信号验证。
    3. 先用 Graph 打穿广告分析闭环:问数、计算、出图、报告、订阅、归因。
    4. 再用轻量事实层接住执行结果:Execution、Artifact、Version、Provenance、Template。

    三、系统设计:从 Conversation 中心迁移到 Artifact 中心

    1. 定义、执行、结果分离:Template / Workflow、Execution / Task、Artifact 的边界。
    2. Artifact 类型:Query、Dataset、Chart、Report、Code、Template 如何稳定命名与版本化。
    3. Provenance 证据链:报告如何追溯到查询、数据、代码、指标口径和模板版本。
    4. Capability 与 Skill 解耦:让业务能力服务多种 Agent Runtime,而不是绑定单一页面或单一 Agent。

    四、业务落地:京东广告数据分析 Agent 如何跑通闭环

    1. 智能问数:自然语言到广告指标、维度、时间、过滤条件和查询执行。
    2. 自动报告:从多问题拆解到图表、摘要、结论和报告 Artifact。
    3. 模板订阅:高端用户沉淀方法,普通用户一键消费稳定报告。
    4. 异常归因:围绕指标波动生成下钻 Graph,并保留执行过程与证据链。
    5. 错误与重试:失败不只是报错,而是能定位到节点、参数、数据源和下一步动作。

    五、方法论总结:从 Data Agent 到组织级数据工作空间

    1. 先纵向打穿高频场景,再抽象平台能力。
    2. 先保证可追溯、可复现、可复用,再追求更复杂的 Workspace 产品形态。
    3. 高端用户生产方法,普通用户消费方法,形成生产者—消费者闭环。
    4. 判断是否值得继续投入 Workspace 的关键买单信号:保存、复用、追溯、分享、模板消费。
    5. 对企业数据平台的启示:Agent-ready 不只是让 AI 能查数,更是让 AI 的工作成果进入组织生产体系。


    听众收益:

    1. 获得一套分析型 Data Agent 从对话式问数走向生产化落地的方法:如何将自然语言问数、指标解读、报告生成、订阅推送和异常归因串成可执行、可复用的数据分析工作流。

    2. 理解 Graph-first、Workspace-light 的工程路径:先用 Graph 打穿高频业务执行闭环,再将 Execution、Artifact、Version、Provenance、Template 轻量沉淀为组织级数据资产。

    3. 借鉴京东广告数据分析 Agent 的真实设计取舍:包括业务语义沉淀、Capability 与 Skill 解耦、结果可追溯、模板复用,以及从个人提效走向组织复用的产品演进方式。


    落地挑战与方案重点:

    1. 挑战一:广告经营分析不是一次性问答,而是多步骤、多口径、多产物的持续工作流。

      方案重点:将查数、计算、出图、报告、订阅、归因拆解为可编排的 Graph 执行过程,并通过 Execution / Artifact / Provenance 记录关键事实,让每份报告和结论都能追溯到具体查询、数据、口径和执行版本。

    2. 挑战二:成功的分析方法难以从个人经验沉淀为组织能力。

      方案重点:采用 Graph-first、Workspace-light 的方式,先让高端用户在真实广告分析场景中探索和调试,再将稳定流程参数化为 Template,供普通用户一键消费,形成“生产者生产方法,消费者复用方法”的组织闭环。


    嘉宾
    DACon 2026 · 北京站
    吴旭晶
    京东集团 京东零售算法工程师
    2026-10-24
    09:30 -12:05
    企业本体与知识工程(出品人:京东集团 算法总监 周默)
    2026-10-24
    09:30-10:15

    本体驱动的Agent实践——从查数、分析到销售决策

    演讲介绍:

    我们曾通过后训练将自然语言问数业务准确率做到接近100%,但知识准备和训练周期很长,扩展到新领域困难,口径变化后也难以维护。为解决这些问题,我们开始用本体组织企业数据,让对象、关系、指标和业务规则成为Agent可理解、可查询的语义结构。本次分享将复盘我们从NL2SQL、MCP、Skill到内置Agent的演进与取舍,并结合销售决策实践,介绍本体如何支撑Agent从查数、分析进一步走向业务决策。


    演讲提纲:

    1.智能问数做得很准之后,我们遇到了什么问题:复盘NL2SQL与后训练方案在扩展和维护上的局限。

    2. 企业数据为什么需要按照Agent的理解方式重新组织:分析业务语义与底层数据结构之间的距离。
    3. 我们如何设计面向Agent的本体:介绍对象、属性、关系、指标、业务规则和语义查询机制。
    4. 从MCP、Skill到内置Agent的三次迭代:复盘灵活性、稳定性和接入成本之间的取舍。
    5. 从查数走向决策:结合销售决策实践,介绍业务事实层、销售认知层和场景执行层。
    6. 本体建设的边界与下一步:分享知识治理、持续优化中尚未完全解决的问题。


    听众收益:

    1.理解NL2SQL在单领域取得较高准确率后,仍然会遇到的扩展、维护和知识更新问题。

    2.了解如何通过对象、关系、指标和业务规则组织本体,降低Agent理解和使用企业数据的难度。
    3. 获得一次基于实际业务场景的本体建模与应用经验,了解本体如何支撑数据应用从查数和分析进一步走向业务决策。


    落地挑战和方案重点:

    1. 本体结构缺少可以直接照搬的标准。我们参考不同方案并结合数据分析需求,逐步形成包含对象、关系、指标和业务规则的本体结构;它仍在持续演进,需要在表达能力、开发成本和长期维护之间做取舍。
    2. Agent的能力边界需要在实践中不断调整。通用MCP足够灵活,但业务知识不足时结果不稳定;领域Skill能够提高效果,但知识容易散落;内置Agent可以统一查询和分析过程,同时也提高了知识运营与评测要求。


    嘉宾
    DACon 2026 · 北京站
    梁伟
    理想汽车 高级算法工程师
    2026-10-24
    11:20-12:05

    基于本体的领域知识工程实践:以金融测试为例

    演讲介绍

    金融测试从经验驱动转向AI辅助,但大模型直接生成仍面临方法难复用、结果难追溯、质量难评估。本次分享介绍基于测试本体与Test IR的平台实践:结合业务本体、沉淀测试方法论,以Test IR打通需求、大纲和案例;Agent负责语义理解与方法选择,工具负责数据计算、案例装配和校验。形成“需求解析—IR—方法应用—案例生成”的可追溯链路。


    演讲提纲

    一、业务背景:为什么需要重新设计 AI 测试平台
    金融测试当前面临的问题
    需求、测试大纲和测试案例之间缺少统一表达。
    测试设计依赖个人经验,优秀方法难以沉淀和规模化复用。
    Dify、提示词、Skill和脚本形成了大量成果,但资产分散、边界不清。
    大模型可以快速生成案例,却容易出现遗漏、幻觉和结果不稳定。

    二、方案选型:为什么选择“本体+Test IR+Agent+工具”
    直接使用大模型:建设快,但生成过程黑盒化,难以稳定复现。
    固定工作流与提示词:适合单一场景,但容易与具体业务和流程强耦合。
    RAG知识检索:能够补充知识,却难以表达方法适用条件、执行步骤和输出约束。
    本体与Test IR:将测试语义、方法、输入输出契约和关系结构化,适合长期治理。


    三、总体架构:平台如何运转

    四、落地挑战与解决思路
    测试场景本体的分层和构建思路,以及本体的管理和演进;
    测试IR的设计和应用。
    测试方法论的构建和应用。

    五、展望与总结


    听众收益

    1、理解业务本体、测试本体和Test IR的职责边界,以及三者如何共同支撑AI测试。
    2、获得一条可渐进实施的建设路线:从现有提示词、Skill和脚本出发,逐步演进为可查询、可治理的测试平台体系。


    落地挑战和方案重点

    1. 测试本体的有效性仍需持续验证。 方法建模过粗,无法指导案例生成;建模过细,又容易与具体业务耦合。需要通过真实大纲、人工案例和执行结果持续校正方法边界。
    2. 生成质量缺少统一行业基准。 文本相似度不能代表测试质量,后续需要重点建立事实保留率、方法选择准确率、测试责任覆盖率、无依据生成率和人工修订成本等评价指标。


    嘉宾
    DACon 2026 · 北京站
    杨冬瑞
    江苏润和软件股份有限公司 人工智能中心 AI架构师
    2026-10-24
    14:00 -17:30
    从分析闭环到行动闭环:Data Agent 的边界突破(ThinkingAI 专题论坛)(出品人:ThinkingAI Agent 首席架构师 王浩强)
    2026-10-24
    14:00-14:45

    从洞察到行动:企业 Data Agent 的闭环架构与工程实践

    演讲内容:

    "企业 Data Agent 已经能够完成提问、取数、分析和建议,但从洞察到业务结果,仍然存在任务交接、业务执行和效果验证等断点。
    本次分享结合 ThinkingAI 企业级 Agent 平台 Agentic Engine 的工程实践,围绕一个贯穿业务场景,拆解“发现问题—分析原因—生成策略—受控执行—验证效果”的行动闭环。重点介绍如何通过结构化上下文与节点验收组织多 Agent 协作,如何通过工具与 Skills 连接企业数据和业务系统,以及如何借助 AI 观测平台追踪执行过程、定位问题。同时,区分 Agent 执行质量与业务效果的验证方法,讨论权限、审批、异常处理与动作补偿等工程边界,为企业构建可追踪、可控制、可验证的 Data Agent 提供参考。"


    演讲提纲:

    内容主线
    以三个问题贯穿分享:决策依据是什么、业务动作如何受控、最终效果如何验证。
    有据可依:将企业数据、业务知识与 Agent 执行链路关联起来,为判断和行动提供可追溯的证据。行动可控:通过明确分工、结构化交接、节点验收与业务审批,让分析结论进入真实业务流程。效果可验:分别衡量执行质量、任务完成情况与业务收益,通过实验和结果反馈持续改进。
    演讲提纲(30 分钟)
    1. 从建议到行动,还缺什么(3 分钟)从一个业务场景切入,说明分析结论在任务交接、执行和验证环节中的断点。
    2. 行动闭环的总体架构(5 分钟)拆解感知、分析、决策、执行与验证的职责,建立 Agent 执行证据与业务效果数据之间的关联。
    3. 一个业务场景中的闭环实践(10 分钟)展示从问题分析、策略生成到审批执行与效果复核的过程,解释多 Agent 如何分工、传递上下文并验收阶段结果。
    4. 让闭环可靠运行的工程机制(7 分钟)重点讨论上下文失真、执行状态不确定和异常恢复;介绍 Trace 追踪、权限约束、审批、重复执行防护,以及停止、恢复或补偿的适用边界。
    5. 如何验证价值与逐步落地(5 分钟)区分执行成功、任务完成与业务收益;介绍对照实验与指标设计,以及从辅助分析到受控行动的演进路径。


    听众收益:

    获得一套从数据洞察走向业务行动的闭环架构与落地思路。理解多 Agent 协作中的上下文交接、节点验收和执行控制机制。掌握通过执行证据定位问题、通过业务指标与实验验证价值的方法。


    落地挑战和方案重点:

    落地挑战:企业 Data Agent 从分析走向行动,需要跨越数据系统与业务系统之间的边界。多 Agent 协作可能出现上下文失真、交接信息不足与错误传播;业务动作可能面临权限不足、状态不明确、重复执行和部分失败;工具调用成功也不能直接说明任务完成或业务收益提升。

    方案重点:依托 Agentic Engine 组织分析、决策、执行与验证流程,通过结构化上下文和节点验收提高协作可靠性,通过工具与 Skills 连接企业能力,并结合权限约束、业务审批和执行状态管理控制动作风险。AI 观测平台提供会话、Trace、模型、工具与 Skill 的执行证据,帮助定位问题;业务任务、触达或曝光记录及效果指标则用于验证动作与结果。根据业务条件引入对照实验,并按动作类型设计停止、恢复或补偿机制,逐步形成可追踪、可控制、可验证的行动闭环。

    嘉宾
    DACon 2026 · 北京站
    王浩强
    ThinkingAI Agent 首席架构师
    2026-10-24
    14:55-15:40

    从 DataAgent 到行动闭环的 Agent 决策执行实践

    演讲介绍:

    企业数据从支撑人查数走向 Agent 决策执行,挑战不只是 Text2SQL,而是口径、上下文、权限与行动风险。易车从 ChatBI、DataAgent 演进到 DataWork,建设覆盖可信数据、语义、本体和知识、MCP 与 Harness 的三层底座,并以查询进化和主动跟进打通分析、行动与结果验证,形成从可信问数、辅助分析到受控执行的企业数据智能演进路径。


    演讲提纲:

    1、从 ChatBI 到 DataWork:易车的实践历程
    2、从“会查数”到决策执行面临的挑战
    3、面向 Agent-Ready 的企业数据建设
    4、建设 Agent 原生底座:构建企业级 Harness 体系
    5、从工具提效到自主洞察:数据智能系统的能力进化
    6、未来规划


    听众收益:

    1.了解易车从 ChatBI 到 DataAgent 的演进过程,以及在其中遇到的挑战。

    2.了解如何做好数据、知识和工具建设,让 Agent 找得到、看得懂、用得好企业数据。
    3. DataAgent 不止于问数,Agent 如何从回答问题走向主动发现、自主洞察和决策执行。


    落地挑战和方案重点:

    1、如何保证 Agent-Ready 的企业知识长期有效
    2、如何实现系统的自动进化


    嘉宾
    DACon 2026 · 北京站
    王林红
    易车 数据平台负责人
    2026-10-24
    15:50-16:35

    知乎 DataClaw:从 MetricFlow 到 AI 原生语义层的演进实践

    演讲介绍:

    从 dbt MetricFlow 引擎到 AI 原生轻量级语义层的演进实践:传统语义层需要人工配置定义指标,维护成本高、不够灵活。我们构建了 AI 原生的轻量级语义层,让 LLM 自动维护指标定义,LLM根据指标定义和用户查询意图来生成SQL。构建知识库来支撑核心指标、核心宽表、业务知识等知识的管理和检索,通过检索让 LLM 每次只加载最相关知识。技术层面,通过定制化切片(指标单独切片、表分层切片、SQL 按语句切片、通用逻辑兜底)+ 混合检索(全文检索 + 向量检索 + WRRF 融合排序 + 名称匹配加权)+ 分层匹配(表级 → 字段级)+ 业务优先级(核心宽表 > 认证表)来保证精确的检索查询。进一步构建 AI原生的轻量级知识图谱,解决多跳关系检索(如"用户 → 订单 → 商品"三跳关系),采用 AI 主导构建和维护,避免重量级图计算。目前知识库+知识图谱的整体团队渗透率超过 65%,常见的简单取数需求能满足100%,团队token 消耗大幅降低。


    演讲提纲

    业务背景
    • 数据团队的核心痛点:
       ◦ 取数依赖分析师,业务方等待时间长
       ◦ SQL 编写成本高,技术门槛限制自助取数
       ◦ 指标口径不一致,分析结果存在差异
    方案选型:三阶段架构演进
    第一阶段:基于 dbt MetricFlow 的语义层
    • 技术架构:dbt Semantic Layer + MetricFlow 引擎 + BM25 指标检索
    • 核心特点:SQL 完全由 MetricFlow 引擎生成,准确性有保障
    • 优势:规范化、类型安全、SQL 准确
    • 局限性:
       ◦ MetricFlow 比较复杂,对特殊指标的支持成本高
       ◦ 不够灵活,无法充分发挥 LLM 的能力
       ◦ 维护 MetricFlow 配置成本高
    第二阶段:知识库建设
    • 设计理念:让 AI 自动生成和使用数据资产
    • 核心转变:
       ◦ 指标定义由 LLM 自动生成,存储为 Markdown 文件
       ◦ 知识库作为 AI 原生语义层的核心支撑
       ◦ 形成"LLM 生成 → 知识库入库 → 增强检索 → LLM 使用"的完整闭环
    • 知识库规模:
       ◦ 1400+ 指标口径
       ◦ 300+ 宽表/认证表
       ◦ 25000+ SQL 模板
       ◦ 业务知识文档
    第三阶段:LLM 知识图谱建设
    • 为什么需要知识图谱:
       ◦ 知识库主要解决单跳检索(如"查询 DAU 指标")
       ◦ 多跳关系检索效果有限(如"用户 → 订单 → 商品"三跳关系)
       ◦ 需要轻量级知识图谱作为补充
    • 设计理念:AI 原生、轻量化
       ◦ AI 主导构建:LLM 从数据资产中自动抽取实体和关系
       ◦ AI 主导维护:自动更新图谱,人工只负责关系确认
       ◦ AI 友好查询:设计 AI 友好的查询接口,不做重量级图计算
       ◦ 与知识库融合:图谱检索结果与知识库检索结果融合
    • 技术方案:
       ◦ 实体识别:从指标、表、字段中抽取实体
       ◦ 关系抽取:识别指标依赖、表关联、字段引用等关系
       ◦ 图谱存储:轻量级存储方案,支持快速查询
       ◦ 融合检索:图谱多跳查询 + 知识库检索的统一接口
    系统整体架构
    下图展示了知识库在整个数据智能生态中的位置:
    架构说明:
    • 工作台层:Codex、Workbuddy、Zwork 等第三方 Agent,通过统一的 data-cli 接入
    • 网关层:大数据CLI 作为 MCP 能力网关,提供安全管控和任务分发
    • 能力层:数据分析-agent(DataClaw 核心)、AB实验-agent、画像-agent、埋点-agent 等专项能力
    • 服务层:
       ◦ SQL查询接口:对接 StarRocks/Spark 执行引擎
       ◦ 知识库检索服务:本次分享的核心模块
       ◦ 数据skill市场:技能沉淀与共享
    • 知识层(本次分享重点):
       ◦ 问题全文检索-知识库:BM25 全文检索
       ◦ 知识图谱-知识库:向量检索 + 关系检索
       ◦ 数据来源:业务逻辑(数仓元数据)+ 产品功能(埋点元数据)
    • 数据层:Paimon/Hive 存储集群,StarRocks/Spark 查询引擎
    本次分享聚焦轻量级语义层的构建和知识库检索服务的建设,包括定制化切片、混合检索、分层匹配等核心技术。
    落地挑战
    挑战一:如何设计针对不同知识类型的切分和检索策略
    • 不同类型的知识结构差异大(指标、表元数据、SQL模板、业务知识)
    • 表元数据需要两级检索(表级 → 字段级),单一检索策略效果差
    • 如何平衡针对性优化和通用性支持
    • 如何让业务优先级在技术上落地(核心宽表 > 认证表 > 普通表)
    挑战二:如何提升混合检索的召回率和精准度
    • 纯向量检索容易被无关结果干扰,分数区分度低
    • 纯全文检索(BM25)对语义理解能力弱
    • 如何融合两路检索结果,既保证召回率又提升精准度
    • 如何针对不同知识类型设计差异化的评分权重
    挑战三:如何构建 AI 原生的轻量级知识图谱
    • 如何让 LLM 自动抽取实体和关系,保证准确性
    • 如何设计和实现 AI 友好的图谱查询接口,避免重量级图计算
    • 如何将图谱检索与知识库检索融合,提供统一体验
    解决思路
    针对挑战一(知识类型差异化):定制化切片 + 分层匹配 + 业务优先级
    • 定制化切片逻辑:为主要知识类型定制切片策略,通用逻辑兜底
       ◦ 指标:每个指标切分成单独的切片(完整口径、计算逻辑、数据来源)
       ◦ 表元数据:表级切片(表名、描述、业务域)+ 字段级切片(字段名、类型、业务含义)
       ◦ SQL 模板:按 SQL 语句和 CTE 语句切分
       ◦ 业务知识:通用 Markdown 切片逻辑兜底
    • 分层匹配策略:表元数据先表级检索再字段级检索,避免字段噪音
    • 业务优先级落地:
       ◦ 核心宽表和认证表作为权威数据资产,直接进入知识库
       ◦ 通过赋予不同权重实现优先级控制(核心宽表 > 认证表 > 普通表)
    • 价值:既保证主要类型的针对性优化,又能直接支持未知类型
    针对挑战二(混合检索优化):全文+向量 + WRRF融合 + 分数优化
    • 检索策略:全文检索(BM25)+ 向量检索(Embedding)并行
    • WRRF 融合排序:加权 RRF 融合两路结果,分数归一化
    • 分数优化:
       ◦ 名称匹配加权:精确匹配、包含匹配、别名支持
       ◦ 分类管理:按知识类型独立检索,避免跨类别干扰
    • 价值:既利用全文检索的精确匹配能力,又发挥向量检索的语义理解能力
    针对挑战三(轻量级知识图谱):AI 主导 + 轻量化设计
    • 实体和关系抽取:
       ◦ LLM 分析指标定义、表结构,自动识别实体(指标、表、字段、业务概念)
       ◦ LLM 识别关系(指标依赖、表关联、字段引用、业务归属)
       ◦ 人工审核确认关系,形成反馈闭环
    • 轻量化存储和查询:
       ◦ 采用轻量级图存储方案(非 Neo4j 等重量级图数据库)
       ◦ 设计 AI 友好的自然语言查询接口
       ◦ 支持常见的 1-3 跳关系查询
    • 融合检索:
       ◦ 用户查询先判断是否需要多跳关系
       ◦ 需要时调用图谱查询,结果与知识库检索融合
       ◦ 统一返回,LLM 综合使用
    • 价值:解决知识库的单跳检索局限,同时保持轻量化
    落地效果
    • 知识库团队渗透率超过 40%
    • 知识库规模:1400+ 指标、300+ 宽表/认证表、25000+ SQL 模板
    • 上下文优化:每次查询只加载最相关的知识,token 消耗大幅降低
    • SQL 生成准确率:充分发挥 LLM 能力,同时通过知识库保证准确性
    • 系统灵活性:从 MetricFlow 引擎约束中解放,支持各类特殊指标
    • 生态开放:通过 data-cli MCP 网关服务 Codex、Workbuddy、Zwork 等多个第三方 Agent
    • 轻量级知识图谱:支持多跳关系检索,AI 主导构建和维护
    未来规划
    • 知识图谱深化:
       ◦ 扩展更多业务关系类型
       ◦ 优化 AI 抽取准确率
       ◦ 探索图谱推理能力
    • 效果评估体系:
       ◦ 标准化评估指标建设
       ◦ A/B 测试框架
       ◦ 用户反馈闭环
    总结
    • 三阶段演进:MetricFlow 引擎 → 知识库建设 → 轻量级知识图谱
    • 核心转变:从"引擎生成 SQL"到"LLM 生成 SQL + 知识库辅助 + 知识图谱补充"
    • 关键创新:定制化切片 + 混合检索 + 分层匹配 + 业务优先级 + AI 原生知识图谱
    • 生态价值:通过 data-cli 服务多个第三方 Agent,构建开放的数据智能生态
    • 未来方向:知识图谱深化与效果评估体系建设


    听众收益:

    理解数据语义层从传统到 AI 原生的演进路径
    从第一阶段 dbt MetricFlow 引擎(SQL 准确但不灵活)、第二阶段知识库建设(1400+ 指标入库,混合检索),到第三阶段轻量级知识图谱(解决多跳关系检索),了解为什么传统引擎方案在 AI 时代需要演进,以及如何通过知识库和知识图谱构建 AI 原生语义层

    掌握大规模知识库和轻量级知识图谱的核心技术
    学习如何管理 1400+ 指标、300+ 宽表、25000+ SQL 模板的知识库,如何通过定制化切片 + 混合检索 + 分层匹配 + 业务优先级提升检索效果,以及如何构建 AI 主导的轻量级知识图谱,实现实体自动抽取、关系识别、多跳查询与知识库融合

    了解 AI 原生的设计理念和实践经验
    理解如何让 AI 主导数据资产的生成、维护和使用全流程,如何在保持轻量化的同时支撑复杂的数据分析场景,以及如何通过知识库和知识图谱的结合,让 LLM 既能精准检索又能理解关联关系


    落地挑战和方案重点:

    挑战一:知识库检索召回率和准确率的量化评估与持续优化
    虽然我们通过定制化切片、混合检索、分层匹配等策略提升了检索效果,但目前缺少标准化的评估体系。具体问题:(1)如何构建高质量的测试集?不同用户的查询意图差异大,如何标注标准答案?(2)如何量化"更好"的检索?是召回率、准确率、NDCG,还是用户满意度?多维指标如何加权?(3)如何针对不同业务领域自适应调整检索权重?目前的权重是人工调优的,如何实现自动化?我们计划引入 A/B 测试框架和用户反馈闭环,但标准化、规模化的评估体系仍在探索中。

    挑战二:轻量级知识图谱的 AI 原生构建与融合检索
    知识库主要解决单跳检索(如"查询 DAU 指标"),但对于多跳关系检索(如"用户 → 订单 → 商品的三跳关系")效果有限。我们构建轻量级知识图谱作为补充,面临三大难题:(1)如何让 LLM 自动抽取实体和关系并保证准确性?需要设计有效的 prompt 工程和人工审核机制。(2)如何保持轻量化?避免引入 Neo4j 等重量级图数据库,采用轻量级存储方案,不做复杂的图计算,只支持常见的 1-3 跳关系查询。(3)如何融合检索?用户查询时如何判断是否需要多跳关系,如何将图谱查询结果与知识库检索结果融合并统一返回给 LLM?这是我们当前正在攻坚的方向。

    嘉宾
    DACon 2026 · 北京站
    汤晋瑄
    知乎 数据平台工程师
    2026-10-24
    14:00 -17:30
    上下文工程:让 AI 真正懂企业(出品人:京东 算法总监 韩艾)
    2026-10-24
    14:00-14:45

    京东B端Agent的上下文工程实践:多层动态Memory让Agent越用越懂用户

    演讲介绍:

    京东零售场景下,我们基于 OxyGent 框架沉淀了一套 B 端 Agent 生产化技术栈。多层多类型的动态 Memory 设计让 Agent 越用越懂用户,把用户画像、反馈与当下焦点分层建模并持续反哺;多层级智能体架构让 Skill Agent 与 DAG Agent 等范式在同一骨架并存,支撑不同业务场景各取所需;DAG 编排通过反馈闭环与步级重试,让 Agent 既能自纠查询、也能借由 Human-in-the-Loop 快速交互从第 N 步整体重跑,逐步收敛误差;长任务生产化在 Web 端做到类本地插件的无超时体验等。多套能力建设,让B端应用从demo走向生产。


    演讲提纲:

    一、业务背景(3分钟)

    · 京东零售B端Agent场景多元:面向商家、数据分析、数据研发等多类场景

    · B端Agent相比C端chatbot更强调长期化、生产化与可复用

    · 核心痛点引出:Agent的记忆缺失、污染、碎片——本质是上下文管理问题


    二、根因:为什么Agent越用越不懂用户?(5分钟)

    · 根因:上下文没有分层、没有持续反哺

    · 用户画像、反馈、当下焦点混在一起的危害:幻觉、答非所问、重复询问

    · 从“多Agent架构”视角切换到“上下文工程”视角——不是Agent不够多,是上下文没管好


    三、核心解法:多层多类型动态Memory设计(15分钟)

    · 为什么需要分层:不同类型的上下文有不同的生命周期和消费方式

    · 长期记忆:用户画像与跨会话偏好、焦点,怎么提取、怎么更新、怎么排序

    · 中期记忆:多轮会话记忆,怎么衔接意图、切换意图、压缩和回溯

    · 短期记忆:任务执行记忆,中长期记忆联动、观测信息处理、复杂信息的简化

    · 工程要点:存储方案、检索策略、注入时机、窗口管理


    四、复杂场景下的上下文“存活”与“恢复”(6分钟)

    · 聚焦问题:B端任务执行的稳定性

    · 编排执行:DAG执行时的上下文隔离与合并,持久化时的上下文复用

    · Human-in-the-Loop与局部重跑时的上下文管理


    五、治理效果与持续演进(3分钟)

    · 简要对比:有分层Memory vs 无分层Memory的效果差异

    · 上下文污染时的表现和恢复机制

    · Memory飞轮:怎么让上下文越用越准而不是越用越乱


    六、总结(2分钟)

    · 核心判断:B端Agent的壁垒不在Agent数量和编排复杂度,在上下文管理质量

    · 可复用的三板斧:分层Memory + 持续反哺 + 污染治理


    听众收益:

    通过京东零售的真实场景案例(商家经营、数据分析等),理解分层Memory在复杂B端任务中的具体表现,尤其是DAG编排执行、Human-in-the-Loop介入、局部重跑等生产级场景下的上下文“存活与恢复”经验,是跟贴近业务实践的优化。


    落地挑战和方案重点:

    落地挑战:
    挑战一:多层memory体系的建设以及与已有agent框架的融合。

    挑战二:定义Memory效果的度量标准,让好坏可量化。

    挑战三:触发时机的判断和内容筛选的标准。

    方案重点:
    重点一:分层分类的memory系统设计,多memory联动的设计。

    重点二:紧密绑定京东B端业务真实痛点的优化策略,不仅仅是通用方案的实现。


    嘉宾
    DACon 2026 · 北京站
    辜立忠
    京东 零售算法工程师
    2026-10-24
    14:55-15:40

    从 BI 到决策智能:DecideX 的上下文工程、证据链与评估闭环

    演讲介绍

    企业在数字化建设与经营实践中积累了丰富的数据资产与决策知识,如何将这些积累转化为Agent理解业务、辅助经营决策的能力?本分享围绕DecideX从BI走向决策智能的设计与实践,介绍如何复用现有数据资产、组织决策知识,构建面向经营场景的上下文。并在此基础上,结合评估闭环,让分析结论可追溯、决策建议可评估、行动效果可复核。最后结合客户案例,围绕客户痛点、实施路径与实践思考,分享决策智能在企业中的落地探索。


    演讲提纲

    1、从BI到决策智能:企业数据资产的复用与价值延伸。

    2、决策上下文工程:数据资产与决策知识的组织和应用。

    3、可信证据链:支撑可解释、可追溯的经营分析。

    4、决策评估闭环:从建议质量到经营效果的持续复核。

    5、客户案例分享:客户痛点、实施路径与实践思考。


    听众收益

    1、了解复用现有数据资产、构建决策上下文的实施路径。

    2、掌握决策知识组织与可信证据链的设计思路。

    3、理解决策质量评估与经营效果复核的方法。


    落地挑战和方案重点

    1、数据资产与决策知识分散:复用现有数据资产,结合经营场景整合决策知识,减少重复建设。

    2、上下文与业务需求不匹配:结合问题和用户权限按需获取相关内容,通过持续更新兼顾准确性与效率。

    3、分析结论缺少可追溯依据:以证据链连接数据、分析和结论,支持解释与复核。

    4、决策建议与效果验证脱节:结合决策质量评估和经营效果复核,持续跟踪业务反馈,形成改进闭环。

    嘉宾
    DACon 2026 · 北京站
    石凯
    观远数据 产品专家
    2026-10-24
    15:50-16:35

    语义层即上下文:理想汽车生产级 Agent 的语义工程实践


    演讲介绍:

    生产级 Agent 的真正瓶颈不在模型能力,而在上下文质量——Agent 拿到的是散落在 Prompt、工具、日志中的碎片化信息,还是经过语义治理、可理解、可追溯的结构化上下文,决定了它能否在生产环境稳定交付。以 Spark/Flink 故障诊断为例,介绍理想汽车如何将散落在 Prompt 与工具中的知识,拆分为本体、OSI、Playbook 和通用执行层,为 Agent 构建高质量的语义上下文。Agent 据此跨日志、指标、数仓取证,形成有证据的根因判断,并将诊断缺口沉淀为可版本化、可校验、可回归的语义资产。还将讨论轻量建模、查询约束及模型探索与工程确定性的取舍。


    演讲提纲:

    生产级 Agent 的上下文挑战:为什么散落知识是最大瓶颈

    语义层即上下文工程:本体、OSI、Playbook 的职责边界与协作

    理想汽车落地实践:从故障诊断到有证据的根因判断

    关键取舍与演进:从单点场景到生产级 Agent 平台


    听众收益:

    掌握一套将专家经验转化为可治理语义资产、为 Agent 提供高质量上下文的方法。
    理解本体、查询语义、Playbook 和工具层在上下文构建中的职责边界。
    学会构建带证据、置信度和答案边界的 Agent 输出,理解语义约束如何提升上下文质量。
    获得一条从单点场景逐步演进到生产级 Agent 平台的实践路径。


    落地挑战和方案重点:

    痛点一:本体、指标关系和 Playbook 仍需要较多人工梳理,跨业务复制效率有限,后续重点是推进语义资产(上下文)标准化和自动生成
    痛点二:面向更大规模应用,还需要解决权限控制、执行追踪、证据状态、结果验证和多运行环境适配等问题,建设可治理、可观测、可扩展的 Agent 运行控制面


    嘉宾
    DACon 2026 · 北京站
    钱瀚
    理想汽车 大数据平台负责人
    2026-10-24
    16:45-17:30

    构建知识工程,推进高质量Agent分析决策

    演讲内容:

    问题:
    - 分析决策agent构建时间长,内容生成效果不稳定
    - agent运行资源占用大,成本高,用户等待的推理时间长
    - 问题优化和效果评估不足,无法找到持续改进的驱动点
    解决过程:
    - 进agent分析决策进行分类,区分不同决策的要素列表
    - 基于决策要素构建知识,覆盖行业、公司、领域、场景、技术等多方面内容,为agent决策的规划有效的工具链路调用,并精准生成提示上下文
    - 建立agent决策的2级评分体系,数字化管理形成提升驱动点


    演讲提纲:

    1.分析agent在公司演进路径和落地场景

    2. 当前使用卡点,以及问题的汇总抽象
    3. agent决策链路拆分,并通过数字化进行效果评估
    4. 迭代知识库和标准数据,推进持续优化
    5. 新的挑战和未来规划


    听众收益:

    1. 分析agent的评估指标体系
    2. 建立标准数据和知识库,支持agent高质量推理


    落地挑战和方案重点:

    1. 如何对agent执行链路拆解到原子步骤,使得单变量可观测可提升
    2,如何度量agent客观数字效果,和业务使用agent体验一致

    嘉宾
    DACon 2026 · 北京站
    赵雪波(元甲)
    马上消费金融 大数据总监
    2026-10-24
    14:00 -17:30
    Data Engineering Agent:数据工程智能
    2026-10-24
    14:00-14:45

    Skill 与 Agent 的边界:数据平台的分层架构实践

    演讲介绍

    一条 SQL 可以解析、执行并返回结果,却仍可能给出错误的业务结论。数据平台引入 Agent 后,真正困难的不是能不能生成 SQL,而是如何划清业务事实、任务方法、运行时判断和外部操作的责任边界。

    本分享以 SQL 生成中的一个实际错误为主线,并以数据质检作为对照,讨论什么任务值得使用 Agent、Agent 可以自主到哪一步。这里的“边界”不是在 Skill 与 Agent 之间二选一,而是哪些稳定方法应该沉淀为 Skill,哪些决策需要 Agent 结合运行反馈完成。

    分享将通过“四层一面”职责模型、自主权决策表和错误归因闭环,说明如何让问题可定位、变更有落点,并将已确认的问题逐步沉淀为平台能力。让 Agent 少猜,让平台多知道一点。

    演讲提纲

    一、问题:SQL 可以执行,为什么业务答案仍然错误

    复盘一个真实案例:SQL 可以解析、执行并返回结果,但与经确认的业务口径和参考结果不一致;

    对比数据质检与 SQL 生成,说明确定性主链与 Agent 决策节点的差异;

    提出核心问题:哪些事实与规则应由平台前置,哪些决策需要结合运行时反馈完成?

    二、判断:什么问题才值得交给 Agent

    Agent 成为候选需要同时满足:目标与成功标准明确,运行中存在无法经济编码的语义判断,能够获得及时可信的反馈,动作空间可以约束,结果可以验证;

    再用风险、可验证性和可逆性确定自主级别;

    现场演示如何用同一张决策表评审两类场景:数据质检落到确定性 Workflow;SQL 生成只在澄清、探查和生成等局部环节保留受约束 Agent,最终执行仍由平台控制和用户确认。

    三、分工:“四层一面”如何界定逻辑职责

    知识与上下文层:版本化管理业务口径和表字段语义,并在任务过程中按需检索、装配和更新 Context;

    Skill 方法层:沉淀 SQL 生成、探查和校验等可版本化、可复用的方法;

    Workflow 与 Agent 决策层:Workflow 负责可编码的状态和分支,Agent 只处理必须结合用户输入和 Tool 反馈完成的局部判断;

    Tool 执行层:提供元数据查询、受限数据探查、SQL 校验等结构化能力接口;

    横向治理面:模型外部的具体系统强制身份权限、参数策略、预算、审批与终止;可观测与评测提供跨层证据和回归验证依据。

    四、治理与收益:错误可归因,变更有落点

    沿用同一个 SQL 案例,展示“错误表现 → 对照证据 → 根因假设 → 单变量验证 → 修正位置 → 回归用例”的完整过程;

    区分 Skill 中的软约束与模型外部、完整中介、失败关闭的硬控制;

    展示分层后的结构性收益:决策归属清晰、变更有最小落点、已确认错误可以进入回归验证;

    根据证据与责任,将已确认问题分别或同时修订到语义资产、Context 装配、Skill、Workflow、Tool 和治理执行点,并沉淀为回归用例。

    五、演进:把运行时未知逐步沉淀为平台能力

    基础阶段:明确任务与风险边界,准备经确认的业务口径、参考问题和评测基线;

    受控能力阶段:建设只读 Tool、身份权限、调用审计、资源预算和失败处理;

    局部 Agent 阶段:先跑通确定性 Workflow,只在必要判断点引入 Agent,并通过 Shadow、Canary、熔断、回滚和人工接管逐步放量;

    持续沉淀阶段:将已确认问题同步沉淀为语义资产、Skill、Workflow 规则、Tool 校验和评测用例;

    总结:让 Agent 少猜,让平台多知道一点。


    听众收益

    评审一个需求:用自主权决策表判断它应该采用确定性 Workflow、受约束 Agent、拒绝还是人工确认。

    定位一个问题:用“四层一面”职责图判断错误应该修到语义资产、Context、Skill、Workflow、Tool 还是治理执行点。

    获得一份可对照自查的改造清单模板:识别团队当前缺少的事实、评测、Tool、权限、可观测与放量机制。


    落地挑战和方案重点

    挑战一:可解析、可执行不等于业务正确

    方案重点:在一致条件下对照错误 SQL 与经确认的参考口径,沿“四层一面”逐项隔离根因,避免将缺少证据的推断直接归咎于模型。

    挑战二:自然语言约束不能充当安全边界

    方案重点:把治理要求落实到模型外部的具体系统,通过身份权限、参数策略、Tool 范围、资源预算、审批、终止、审计与评测控制风险。


    嘉宾
    DACon 2026 · 北京站
    郭志浩
    瓴岳信息(洋钱罐)数据平台数据应用负责人
    2026-10-24
    15:50-16:35

    从需求澄清、AI Coding、AI Testing 到 Notebook 分析:得物 Agent Harness 贯穿数据研发全链路的落地实践

    演讲介绍:

    数据研发不缺会写 SQL 的助手,缺的是从需求澄清到 Notebook 分析都能交得出来的编排。口径靠口传对齐,开发与验收上下文割裂,测试靠人工兜底,分析结论难复用——时间耗在链路断裂处。得物用 Agent Harness 贯穿需求澄清、AI Coding、AI Testing 与 Notebook 分析,并留下 IDE Review、STOP 等人机确认卡点。本场给出一套从需求澄清到 Notebook 分析的全链路落地实践。


    演讲提纲:


    一、开场:全链路比单点更难,难在上下文,不在模型

    - 数据研发四环节高成本画像:需求澄清 → AI Coding → AI Testing → Notebook 分析

    - 根因判断:时间成本层层累积,本质是「环节间上下文割裂」;找表、编码、查数、诊断、交接各自割裂,而非模型能力不足

    - 本场承诺:讲清全链路为何更难、也更值,细节放到后面的选型与落地

    二、选型对比:从 Copilot 到 Harness,不追求全自动,追求可编排、可回滚

    - 路线对比:单点 Copilot、固定 Workflow、多 Agent 自由协作 vs Harness 受控编排

    - 为何选 Harness:分层底座——Agent 理解调度 · Skill 固化专家流程(步骤/校验/失败分支/人工闸门)· MCP/CLI 读写执行 · Web/Notebook 做入口;再叠加会话记忆与工具收敛

    - 人机协作界面选型:CLI × Web IDE——Agent 组装产物后推 IDE Review,人确认才算交付;把「可信边界」做成产品能力

    - 工具边界选型:元数据探索用 MCP,执行面收敛到 CLI(建改任务 / 临时查询),避免工具面失控膨胀

    - 取舍结论:不追求全自动替人,而追求全链路可编排、可度量、可回滚

    三、落地细节:四类 Agent 如何在同一套 Harness 上贯通

    - 需求澄清:意图澄清、智能找数(STOP 选表)、质量门禁;语义资产人审后进入研发

    - AI Coding Agent:研发闭环「确认模型 → 建表 → 建任务 → 补依赖校验 → 只存开发态草稿」;CLI 组装多 fileType 推 Web IDE,人在 IDE 审 Diff/草稿后再确认提交才计入 AI Commit(各引擎能力不完全对称,如 MC SQL 侧重改任务)

    - AI Testing 能力:AI CR + AI 验数;冒烟 / 基线 / DQC + SQL 预编译与质量门禁;离线/Spark 诊断走「采证→假设→人验证」证据链(工具链 Agent 化,而非单一万能测试 Agent)

    - Notebook 分析 Agent:AI 写作辅助(续写 / 扩写 / 总结 / 解释 / 出图)+ 结论沉淀与复用

    - 关键工程难点:多端上下文一致性;上下文预算(filter 优先、详情过大落盘);项目空间必须人选定、禁止从库名推断;生成可信度与确认卡点设计


    听众收益:

    - 对照:把自家澄清 / Coding / 测试 / 分析对上号,找到可增量落地的切口

    - 拿走:一套 Harness 编排方式,以及效果怎么被讲清楚,而不只是感觉变快了


    落地挑战和方案重点:

    1. 上下文如何不断裂:Agent 在 CLI 里执行、人在 IDE 里确认,两端状态容易各记各的。方案重点是把工具和记忆收口到 Harness,用人选表、选空间、审 Diff 把状态钉住。

    2. 如何让 AI 初稿过得了人审:生成容易,交出去难。方案重点是「AI 出初稿,人管口径与结果」——推到 IDE 审过再写入/发布,才算交付,不把全自动当成目标。

    嘉宾
    DACon 2026 · 北京站
    林风
    得物 技术专家
    2026-10-24
    16:45-17:30

    AI Native数据操作系统

    演讲介绍:

    核心理念:以交付物(物理表、逻辑表/指标、数据看板、AB实验)为导向,由面向人转为面向AI驱动全流程,人聚焦关键决策节点,AI不承担责任。

    技术架构:基于云原生架构,采用MCP+Skill模式将平台能力抽象为标准化原子操作,支持沙箱机制保障信息安全,已适配多种模型。

    角色体系:设计DA(消费者)、DE(生产者)、DG(架构质量守护者)三Agent协作模式,边界由系统定义而非人为摩擦。

    知识库:分层分类构建,正负信号持续回流,形成"越用越智能"的飞轮效应。

    落地策略:对存量系统采取GUI+API并轨的务实演进路径,而非推倒重建。


    演讲提纲:

    传统数据研发现存痛点
    AI‑Native设计理念
    组织协作飞轮与知识库体系
    三大Agent协同架构
    沙箱、路由运行机制
    权责划分:AI定位边界
    存量系统兼容:GUI & LUI双轨模式
    迭代策略:研发‑试跑‑规模化
    工业落地现实挑战
    规模化落地解决方案
    数据看板双搭建模式:SPEC & VIBE
    大模型底座选型思路
    整体架构总览
    落地业务价值总结


    听众收益:

    1. 获得"AI提效"的认知升级:从单点工具到全流程组织智能跃升
    多数团队对AI的应用还停留在代码补全、SQL生成等"自底向上"的单点辅助阶段。本演讲提供了一个关键洞察:真正的效率瓶颈不在编码,而在多角色间的信息对齐与协作流转。听众会建立起"AI Native"的系统性思维——以交付物为导向、让AI串联全链路,而非仅仅加速某个环节。这个认知转变可以直接迁移到各自团队的数据工程实践中。

    2. 获得一套可复用的组织协作设计模式:DA/DE/DG 三Agent体系
    演讲提出了将数据团队角色抽象为"生产者-消费者-质量守护者"三Agent模式,由系统定义边界而非人为摩擦。这套模式解决了一个普遍难题:如何在引入AI后重新划分人与AI的权责。其中"AI不背锅、人聚焦关键确认节点"的原则,以及DG作为架构质量检测切面的设计,对任何正在推进AI落地的数据团队都有直接参考价值。

    3. 获得从Demo到工业级落地的实战经验与避坑指南
    演讲坦诚分享了AI应用在真实生产环境中遇到的具体问题——文件写入错乱、上下文失控、异常信息与实际原因不符等。这些是只有真正做过工程化落地才会踩到的坑。同时给出了务实的应对策略:存量系统采用GUI+API并轨而非推倒重建、知识库正负信号双向回流形成飞轮。听众可以直接借鉴这些经验缩短自己团队的试错周期。


    落地挑战和方案重点:

    1.数据变更Harness设计
    2.多链路Loop机制
    3.组织智能飞轮设计

    嘉宾
    DACon 2026 · 北京站
    legend
    京东 技术负责人
    2026-10-24
    14:00 -17:30
    企业本体与知识工程(出品人:京东 算法总监 周默)
    2026-10-24
    14:00-14:45

    从数据到决策:用户增长本体论 UGO —— 京东零售用户运营技术团队的探索

    演讲介绍:

    当前用户增长业务存在多端数据割裂、指标口径混乱、用户ID不统一等问题,导致增长分析失真,精细化运营落地难,原有离线实时双栈架构维护成本高、数据延迟最高达2小时。本次摒弃传统分层数仓模式,采用用户本体论数仓架构,以用户OneID为核心重构数据体系,统一埋点与指标标准。落地中攻克了百亿级用户行为数据合并、多源数据冲突、实时增量更新三大痛点,通过本体建模、增量计算、口径归一化方案优化,实现指标偏差大幅减低,增长策略迭代效率大幅提升,精准赋能拉新、促活、留存全链路增长运营。


    演讲提纲:

    1.业务背景与行业痛点

    - 用户增长业务核心诉求:全链路用户行为追踪、精细化分层、增长效果归因、策略快速迭代
    - 传统数仓核心问题:数据孤岛严重、指标口径不统一、实时离线架构割裂、海量数据查询低效
    - 业务负面影响:增长分析失真、用户分层不准、运营策略滞后、资源投放浪费

    2. 技术方案选型与核心思路
    - 方案对比:传统分层数仓VS用户本体论数仓的适配差异
    - 核心选型:以用户本体为核心、OneID全域关联、实时离线一体化架构
    - 技术栈组合:Flink实时计算+Spark离线复盘+本体建模分层+自动化质量管控
    - 核心设计:用户实体统一、行为事件归一、增长指标标准化体系搭建

    3. 落地核心挑战与攻坚过程
    - 数据层:多源异构数据冲突、百亿级用户行为数据合并与清洗难题
    - 计算层:实时数据积压、增量更新成本高、查询响应慢问题
    - 业务层:历史指标体系臃肿、业务侧口径认知不统一,落地适配难

    4. 针对性解决思路与落地方案
    - 数据治理:精简冗余埋点、统一事件标准、搭建OneID全域映射体系
    - 架构优化:实时增量计算替代全量刷新,解决数据延迟与资源浪费问题
    - 机制建设:建立指标归口管理、自动化数据校验、问题快速响应机制

    5. 落地成效与数据复盘
    - 技术成效:数据延迟、指标准确率、计算资源消耗优化数据
    - 业务成效:用户分层精准度、增长策略迭代效率、投放ROI提升效果

    6. 现存短板与未来迭代规划
    - 当前方案未解决的痛点瓶颈
    - 短期优化:智能化数据质检、标签体系轻量化迭代
    - 长期规划:AI赋能用户增长预测、自动化策略归因、数仓成本精细化管控


    听众收益:

    1.架构认知升级:打破传统分层数仓固化思维,掌握用户本体论数仓的核心设计理念,理解用户增长场景下“以实体为核心”相较于“以流程为核心”的架构优势,明确增长数仓专属的建模逻辑与适配场景。


    2. 实战问题可复用经验:获取用户增长数仓落地的高频痛点解决方案,包括多源数据归一、指标口径统一、实时离线架构融合、海量行为数据高效处理等实战方法,可直接迁移至企业用户运营、精细化增长相关数仓建设场景。

    3. 业务技术融合思维:学会从增长业务视角反向定义数仓建设标准,掌握“技术落地服务业务增长”的实操路径,规避数仓建设重技术、轻业务、沦为数据孤岛的常见问题,提升数据驱动增长的落地能力。



    落地挑战和方案重点:

    痛点1:全域OneID归一准确率与增量同步平衡难题
    落地中发现,多端匿名用户、游客账号、渠道分身数据存在大量ID冲突与关联断裂问题,历史全域OneID匹配准确率仅87%。同时,每日百亿级增量行为数据实时同步时,精准ID关联会消耗大量计算资源,若追求极致准确率则会导致数据产出延迟升高,若保障时效性则会降低ID匹配精度,形成准确率与时效性的天然矛盾。当前方案仅通过规则引擎+模糊匹配优化至96.2%准确率,仍存在3.8%的用户关联偏差,无法支撑超高精度的用户归因与精细化分层,是后续迭代的核心痛点。

    痛点2:增长指标体系臃肿与迭代效率矛盾
    用户增长业务迭代快、运营场景灵活,长期积累形成大量冗余、重复、口径不一致的指标,存量有效指标仅占65%。虽然已完成核心增长指标(拉新、转化、留存、复购)的口径统一,但业务侧临时场景化指标需求频繁,传统人工审核、迭代、上线流程繁琐,导致标准化体系固化与业务灵活迭代的冲突。一刀切的标准化管控会限制运营灵活性,宽松管控又会再次引发指标混乱,目前暂无完美适配的动态管控方案,是增长数仓长期治理的核心难点。

    方案重点总结:本次落地核心围绕“用户本体统一、数据口径归一、实时离线融合”三大核心,优先解决业务核心痛点,保障增长数据的准确性与时效性。同时正视架构短板,不追求方案完美落地,通过阶段性优化、动态治理,平衡技术性能、成本与业务灵活性,为后续智能化、轻量化数仓迭代预留拓展空间。


    嘉宾
    DACon 2026 · 北京站
    周默
    京东集团 算法总监
    2026-10-24
    15:50-16:35

    自进化数据智能体:迈向 Data–Ontology–Agent 协同进化

    演讲介绍:

    面向表格、数据库与文档等异构数据环境,现有数据智能体仍面临业务意图、数据语义与工具执行难以对齐的问题。传统固定工作流、检索增强和静态知识图谱通常缺乏对开放任务与动态数据的持续适应能力。本报告围绕Data–Ontology–Agent协同进化展开,介绍一种以Ontology为可执行语义中间层的方法框架,统一建模领域概念、工具能力与数据模式,并基于智能体交互轨迹开展失败归因、知识修正和成对评测门控。报告将结合自主数据科学系统实践,讨论其关键机制、实验观察、落地边界及未来研究方向。


    演讲提纲:

    一、业务与技术背景:数据智能体为何仍然“不理解数据”

    1. 企业数据同时分布于表格、数据库、文件和业务文档中,存在口径不一致、关系隐含和持续变化等问题。

    2. 大模型虽然具备较强的推理和工具调用能力,但在业务意图、数据语义、工具操作与物理模式之间仍存在明显的Agent–Data Gap。

    3. 典型错误并非来自模型幻觉,而是来自数据对象识别、字段语义映射和工具选择错误。


    二、方案选型:为什么需要Ontology语义层

    1. 固定工作流具有较强确定性,但难以覆盖动态、开放的数据分析需求。

    2. RAG能够补充文本背景,却难以描述工具约束和数据结构之间的可执行关系。

    3. 静态知识图谱能够表达实体关系,但建设和维护成本较高,难以根据智能体交互持续更新。

    4. 选择Ontology作为Data与Agent之间的可执行语义中间层,同时承载业务知识、工具知识和模式知识。


    三、落地挑战:从静态Ontology走向自进化Ontology

    1. 冷启动阶段如何确定语义知识的范围、粒度和组织方式。

    2. 如何从复杂交互轨迹中区分模型推理错误、工具错误和语义层缺失。

    3. 如何避免自动修改引入错误知识、局部过拟合或已有能力回退。

    4. 如何协同维护内容、工具和数据模式三个相互关联的层次。


    四、解决思路:Data–Ontology–Agent协同进化

    1. 构建三层Ontology:

       · Content Layer:描述业务概念、指标口径、实体关系和领域知识;

       · Tool Layer:描述工具能力、调用参数、前置条件和执行约束;

       · Schema Layer:连接逻辑业务概念与具体表、字段及文件结构。

    2. 利用智能体与数据环境的真实交互轨迹进行失败归因,定位语义层中的知识缺口。

    3. 针对内容、工具或模式层生成候选修改,而非直接修改模型或无限扩充上下文。

    4. 通过持出验证集上的成对评测门控,判断修改是否提升目标能力并保持已有能力。

    5. 对通过验证的修改进行版本化发布,对无效或产生回退的修改进行拒绝和回滚。

    6. 形成“数据暴露问题—智能体产生轨迹—Ontology沉淀知识—智能体再次验证”的持续进化闭环。


    五、系统实践与阶段性成效

    1. 将上述思路应用于自主数据科学智能体,支持从原始数据读取、清洗、探索分析到报告生成的完整闭环。

    2. 相关系统已稳定运行6个月,注册用户超过2000人,深度用户约400人。

    3. 系统获得300余所高校和研究机构的试用申请,为语义层优化积累了大量真实任务和交互轨迹。

    4. 通过具体案例展示语义错配的识别、Ontology修改、评测门控及修正前后的执行差异。


    六、未来规划

    1. 从单智能体反馈扩展到多智能体协同的Ontology治理与知识验证。

    2. 将语义层进化与强化学习结合,使智能体学习何时读取、质疑和修正Ontology。

    3. 从结构化数据扩展至文档、图像和多模态数据,构建跨数据形态的统一语义层。

    4. 探索跨组织、跨领域Ontology的安全迁移、共享与持续演化机制。


    七、总结

    1. 数据智能体的核心瓶颈不仅是模型能力,更是智能体缺乏对真实数据世界的稳定语义理解。

    2. Ontology不应只是静态知识库,而应成为可读、可执行、可验证和可持续进化的语义基础设施。

    3. 数据、Ontology与Agent的协同进化,是数据智能体从演示系统走向长期生产系统的重要路径。


    听众收益:

    1. 建立对Agent–Data Gap的系统认知,理解数据智能体的错误为何经常发生在模型推理之前,并能够区分模型、工具、数据和语义层问题。


    2. 掌握可执行Ontology的设计方法,了解如何通过Content、Tool和Schema三层结构连接业务意图、工具操作与底层数据。


    3. 获得一套可落地的自进化机制,包括交互轨迹归因、候选知识修改、成对评测门控、版本管理与安全回滚,可用于企业数据智能体的持续优化。


    落地挑战和方案重点:

    1. 挑战:Ontology冷启动和持续维护成本高


    企业的数据口径、业务规则和物理模式持续变化,依赖专家手工维护的静态Ontology容易过期,也难以覆盖智能体在真实任务中遇到的长尾问题。


    方案重点:从少量高质量种子Ontology开始,通过真实交互轨迹识别高频失败模式,按需扩展Content、Tool和Schema知识,避免一次性建设“大而全”的语义体系。


    2. 挑战:自动进化可能引入错误知识和能力回退


    单条失败轨迹可能包含偶然噪声,直接将智能体生成的修改写入Ontology,容易造成错误传播、局部过拟合和已有任务性能下降。


    方案重点:对候选修改执行持出集上的成对评测,同时验证目标任务提升和原有能力保持;只有通过门控的修改才能版本化发布,并保留完整的审计和回滚能力



    嘉宾
    DACon 2026 · 北京站
    张绍磊 博士
    中国人民大学 助理教授
    2026-10-24
    16:45-17:30

    Shopee:基于图平台的反欺诈本体建模与智能决策实践

    演讲介绍:

    面对电商促销和信贷中账号、设备、交易等多实体协同伪装,传统表格模型难以识别团伙欺诈。Shopee 图平台将对象、关系与风险规则进行本体化建模,形成动态反欺诈知识网络:图数据库支撑实时关联查询,图计算发现社区和关键节点,图学习模型预测风险。针对异构关系、特征供给与训练效率挑战,平台以统一建模、特征预取和批处理实现工程化落地。


    演讲提纲:

    1. 业务背景:反欺诈为何需要知识工程
    电商促销和金融信贷中的用户、账号、设备、订单等对象关系复杂且持续变化;传统表格模型难以识别团伙型、跨场景欺诈。目标是将对象、关系和风险规则沉淀为动态反欺诈知识网络。

    2. 方案选型:一站式图平台与知识构建
    Shopee 图平台集成图数据库、图计算和图学习:图数据库支持实时关联查询,图计算挖掘社区和关键节点,图学习预测风险。通过统一实体、关系和规则建模,形成可复用的风险知识底座。

    3. 实践一:Monee Credit 用户关系图与信贷风控
    构建融合用户、手机号、设备等实体关系的 User Graph,利用图学习模型识别关联风险,贷前和贷中识别效果都提升明显,通过图数据库对线上借贷申请进行实时资质审批。

    4. 实践二:Shopee 订单促销知识图谱与欺诈检测
    围绕订单、买卖家、活动、优惠和设备构建促销反欺诈图谱,结合图计算和 RGAT等图学习模型识别黑产团伙与异常交易链路,识别出大量的潜在欺诈损失。

    5. 落地挑战与工程化实践
    针对大规模异构关系、实时更新、特征供给和训练效率等挑战,建立图数据建模、图计算和图学习协同流程,并通过特征预取、批处理等手段优化训练与推理效率。

    6. 未来规划与总结
    进一步演进为可解释、可推演的动态反欺诈本体;探索 GraphRAG 与 Agent,基于可信的实体关系、规则和证据链辅助风控分析与决策。图平台的价值在于让业务知识、规则和模型形成持续迭代的闭环。


    听众收益:

    了解面向企业的知识工程方法:如何将业务对象、关系和风险规则进行本体化建模,构建可实时演化的知识网络。

    掌握图数据库、图计算和图学习的选型边界与协同方式,理解其在实时关联查询、团伙识别、规则挖掘和风险预测中的作用。

    获得电商促销和金融信贷风控实践经验,了解如何将复杂关系数据转化为可落地的欺诈检测能力,并形成数据、规则与模型闭环。


    落地挑战和方案重点:

    动态知识构建效率不足:当前图计算以全量计算为主,实体和关系持续变化时,社区、连通性等图特征往往需要重复全量构建,导致资源消耗和更新时延较高。后续重点是探索增量图计算、流式关系更新和特征增量维护。
    图学习模型可解释性不足:图模型能够识别关联型和团伙型欺诈,但预测结果不易直接映射为业务人员可理解的实体、关系和规则证据。后续重点是结合关键子图、节点/边贡献度及业务规则,构建可追溯、可验证的风险解释链路。

    嘉宾
    DACon 2026 · 北京站
    张松清
    Shopee 图平台负责人
    2026-10-24
    14:00 -17:30
    AI 时代的研发范式与组织进化(出品人:新浪微博 高级总监 李庆丰)
    2026-10-24
    14:00-14:45

    ZTE:基于Harness Engineering驱动的全栈智能体交付实践


    演讲介绍

    背景介绍:70%的需求消耗90%的能耗,传统交付模式存在严重的效能瓶颈

    演讲目标:借助AI Agent构建全栈能力底座,从传统多角色协作的跨职能接力演进为单节点全栈闭环。


    效能提升30%。

    论点一:组件整体累积穿刺案例达230+,累积参与人数达30;整体总结基于当前一站式流程需求开发效率提升 ≥  6倍,代码采纳率 ≥ 70%。

    论点二:基于多领域穿刺案例,故障分析结果平均采纳率达到 60%+,诊断结果平均采纳率达到 50%+;

    结论:AI不是替代开发者,而是让每个开发者拥有10倍效率杠杆。

    下一步行动:构建 AI 驱动的自进化研发体系,实现从辅助开发到自主交付的演进。


    演讲提纲

    1. 业务交付效能提升瓶颈

    1.1 传统软件交付模式的效能瓶颈:串行协作、知识孤岛与交付断层、能力边界扩展与全栈化转型的技术难点

    2. 全栈智能体交付体系设计

    2.1 体系架构:贯穿"需求分析-方案设计-编码实现-质量验证"的全链路闭环 

    2.2 核心定位转型:从"人工转译"到"智能体主导"的生产力重构

    2.3 技术底座:Agent Skills + MCP 的能力编排与资产化运营框架

    3. 一站式需求开发智能体构建

    3.1 七阶递进式工作流:需求分析 → 方案设计 → 编码实现 → 编译调试 → 测试验证 → 代码评审 → 总结提交 

    3.2 关键技术创新:渐进式提示词披露、分层资源加载与上下文优化

    4. 自动化质量保障与自修复技术

    4.1 编译自修复:错误日志智能分析、问题定位与补丁生成的自动化闭环 

    4.2 测试自修复:FT用例失败诊断、逻辑缺陷识别与自适应调整机制 

    4.3 代码评审智能体:AI辅助+人工聚焦的双层质量把关体系

    5. 一站式运维诊断"熄灯工厂"

    5.1 故障处理模式的智能化重构:从人工驱动到Agent驱动的范式转移

    5.2 自诊断流水线:故障采集 → 领域识别 → 代码锁定 → 智能诊断 → 结果反写 

    5.3 自修复流水线:在线修复 → 自动测试 → 代码提交的无人化闭环 

    5.4 效能目标:30%故障自诊断、10%故障自修复的量化实践

    6. 规模化落地与工程化建设

    6.1 多领域穿刺验证:核心领域的实践路径 

    6.2 Skill资源池运营:高频场景沉淀、版本管理与持续演进机制 

    6.3 一体化平台看板:研发效能可视化与全流程可追溯能力

    7. 未来展望


    听众收益

    了解从传统多角色协作向全栈智能体交付转型的完整技术路径与工程实践。

    掌握Agent Skills + MCP 架构下的能力编排、资产化运营与规模化落地方法。

    学习编译自修复、测试自修复、故障自诊断等自动化质量保障技术的实现思路。


    落地挑战和方案重点

    基于Harness Engineering一站式交付落地实践

    嘉宾
    DACon 2026 · 北京站
    路芳芳
    中兴 研发改进负责人
    2026-10-24
    15:50-16:35

    百度:研发角色融合下的一站式产研平台实践


    演讲介绍

    随着大模型能力逐步提升、Agent不断优化,软件研发领域正在不断地发生变化,其中很大的一个趋势是角色变得模糊,组织层面上,产品、设计、研发、测试、运维正趋向融合。但随着角色融合的不断推进和深化,领域经验不同、研发环境脆弱等问题也浮出了水面,甚至在部分业务中造成了故障、事故等预期外的结果。本次分享将着眼角色融合的大背景,提取过程中遇到的困难,尝试通过一站式的产研平台的形式给出针对性的解决方案,并从组织的视角解剖“小团队、办大事”的团队、环境、人才、基建、流程等变革。


    演讲提纲

    1. Agent发展加速软件研发变革:角色融合的快速演进。

    2. 变革时代下的挑战与机遇:一人多角色的实施难点。

    3. 通过基建打造组织进化路线:使用一站式产研平台打消角色融合阻碍。

    4. 从平台到真实业务收益:实践案例解剖与对比。

    5. 个人提效迈向组织提效:进化后的组织与流程。


    听众收益

    1. 对于已经深度落地Agent开发、取得明显的个人提效的组织中,困于真正的交付效率提升依然有限。本分享将从组织、流程等角度解剖、分析其中原因。

    2. 对于尝试在流程、组织层面推动变化和提效的团队,困于各种阻力与实际问题落地进展不理想。本分享将从最主要的痛点出发,提出可行的解决方案。

    3. 对于借用平台、工具落地实践角色融合、一人多角的团队,困于社区解决方案与组织适配度有限。本分享将以自身实践为牵引,提出平台工具对于推进落地最关键的因素。


    落地挑战和方案重点

    1. 部分团队急切期望产品输出代码、研发介入产品设计。但因为不同角色天然的技能差异、知识壁垒,单纯以Agent为工具,会大量出现诸如“PM乱写代码进不了生产工程”、“研发无视业务背景乱提需求”这样的现象。单纯的Agent无法解决这些问题,需要知识、基建等一系列建设让所有角色能相互站在对方的肩膀上,从同一个高开始工作。

    2. 不少团队进行了大量的工作解决多处单点问题,但最终没有在真正的交付效率上有质的变化。这是因为单点问题的解决往往无助于信息的打通、流程的共享,使得Agent只工作与狭隘的上下文上,无法突破原有的“需求是需求、工程是工程”的框架隔阂,最终停留在个人提效之上,组织依然只得到是非常有限的收益。


    嘉宾
    DACon 2026 · 北京站
    孟小萱
    百度 资深工程师
    2026-10-24
    16:45-17:30

    从个人提效到组织跃迁:AI时代的研发管理实践

    演讲介绍

    AI工具正在显著提升研发人员在编码、测试、文档和问题分析等环节的效率,但个人效率的提升,并不必然带来组织生产力的同步跃迁。传统研发流程、协作机制、管理方式和评价体系,可能成为AI价值释放的新瓶颈。

    本次分享将结合研发管理实践,探讨企业如何从“使用AI工具”走向“重构研发体系”:推动AI融入需求、设计、开发、测试与运维全流程;重新设计人与AI的分工协作;调整管理者角色和团队能力结构;建立兼顾效率、质量与业务价值的衡量机制。


    演讲提纲

    1、为什么个人提效难以转化为组织跃迁

    2、AI时代研发管理的四个关键变化

    3、新浪微博研发管理实践

    4、未来展望


    听众收益:

    1、理解个人效率、团队效率与组织生产力之间的本质差异。

    2、获得“个人增强—团队协同—组织重构”的分阶段推进框架。


    落地挑战和方案重点

    研发流程的重构打破原有平衡,形成新的风险和挑战

    嘉宾
    DACon 2026 · 北京站
    李庆丰
    新浪微博 高级总监
    2026-10-24
    14:00 -17:30
    非结构化数据处理与知识获取(出品人:《老刘说NLP》技术社区主理人 刘焕勇)
    2026-10-24
    14:00-14:45

    NL2Pipeline:让 AI-Ready 数据处理走向自动化


    演讲介绍

    当下 AI 应用落地加速,企业普遍面临一个共性问题:大规模数据资产需要先转化为 AI-Ready 数据,才能真正服务于模型和应用。无论是 LLM 训练微调,还是 RAG 知识库构建,都需要完成大量数据清洗、质量评估、结构化转换、语义增强和流水线复用等工作,而这些数据准备能力往往决定了最终效果的上限。
    传统脚本式处理方式难以支撑大规模、跨场景、可追踪的数据生产需求,单点的 NL2SQL 也无法覆盖复杂数据准备流程。
    本议题将以开源框架 DataFlow 及近期发布的 DataFlow-Harness 为核心,分享我们如何通过 Pipeline + 算子编排 模式,构建面向大规模 AI-Ready 数据准备的工程底座,并进一步用 DataFlow-Harness 弥补 NL2Pipeline 的关键缺口——让用户可以通过自然语言描述数据准备目标,再由 WebUI 或 CodingAgent 结合 MCP/Skill 调用,将需求转化为可执行、可调试、可复用的数据处理 Pipeline。
    目前 DataFlow 已在工业界大规模落地,合作商汤、腾讯、北京大学、国家电网、库帕思、快手等多个企业与机构,为其提供 AI-Ready 数据集或数据工程服务,本议题也将结合实际落地中的工程挑战与踩坑反思,为企业建设 Data Engineering Agent 提供一条从数据底座到智能编排的实践路径。


    演讲提纲

    1. 企业 AI 落地中的 AI-Ready 数据准备挑战
    2. DataFlow 的 Pipeline + 算子编排设计
    3. 从 NL2SQL 到 NL2Pipeline:DataFlow-Harness 的自然语言 Pipeline 生成与调用机制
    4. AI-Ready 数据集与数据工程服务的典型落地实践



    听众收益

    了解 AI-Ready 数据准备在企业 AI 落地中的关键作用,掌握 DataFlow 通过 Pipeline 与算子编排构建可复用数据生产链路的方法,并理解 DataFlow-Harness 如何弥补 NL2Pipeline 缺口,为 Data Engineering Agent 建设提供实践参考。


    嘉宾
    DACon 2026 · 北京站
    强美伊
    北京大学 DCAI 实验室研究助理 &元枢智汇联合创始人
    2026-10-24
    14:55-15:40

    企查查:表格识别、VLM幻觉修正与文档解析加速的工程实践

    演讲介绍

    企查查是企业信用查询领域领头羊,而企业征信领域必然会涉及到大量的金融公告文档、声明公告等,我们从数据层面加强模型对复杂的金融公告中的表格结构识别能力、从算法层面解决和提升模型无法处理的特殊场景、再引入前沿的Dflash算法来提速不降智,最后下游任务讲基于这些解析出的高质量的元素来进行信息抽取。


    演讲提纲

    1. 智能文档解析在企查查中的需求(海量的金融公告、标书文档)

    2. 训练-数据为王(如何定向找出缺陷数据,提升模型能力)

    3. 特殊场景下的算法优化(超长图片切割、vlm幻觉修正、印章和水印的特殊处理)

    4. 算法带来的质量提升与性能提升(模型加速、跨页表格合并)

    5. 下游应用(信息抽取、agentic-rag)

    6. 总结


    听众收益

    1. 了解到智能文档解析,了解到其中的难点

    2. 了解智能文档解析的应用


    落地挑战和方案重点

    1. 海量文档解析速度慢

    2. vlm幻觉

    嘉宾
    DACon 2026 · 北京站
    陈汝龙
    企查查 数据部AI负责人
    2026-10-24
    15:50-16:35

    非结构化文档的内容理解与样式还原——从RAG知识供给到PDF转Docx的工程实践

    演讲介绍

    非结构化文档是RAG系统和AI应用落地的核心瓶颈。本次分享将介绍我们围绕知识增强RAG和PDF转Docx两个方向,构建的通用文档解析与样式还原技术体系。

    在解析侧,我们采用Pipeline多模型协同与多模态大模型两套并行方案。前者通过版式分析、表格解析、公式识别等模块分工协作,后者以统一模型+差异化Prompt实现端到端结构化输出。

    在样式还原侧,通过规则驱动的流式重构和代码生成式还原两套方案,实现PDF到可编辑Docx的高保真转换。


    演讲提纲

    1.非结构化文档解析的应用场景与挑战

    2.通用文档解析系统设计与方法路线

    3.系统组件划分与垂直场景定制优化

    4.从PDF到Docx:页面样式还原

    5.总结与展望


    听众收益

    1. 理解非结构化文档解析在RAG系统中的关键作用与工程全貌;

    2. 掌握“内容理解”与“样式还原”两条技术路线的差异与协同;

    3. 获得垂直场景定制化解析和工程化落地的实践经验。


    落地挑战和方案重点

    1. 复杂版式下解析准确率与结构化完整性的平衡

    Pipeline方案虽可针对性优化各子模块,但模块间误差累积问题突出;多模态方案端到端能力强,但在细粒度结构还原(如表格单元格坐标属性等)上仍有不足


    2. 样式还原中“视觉相似”与“结构合规”的双重约束

    既要让生成的Word文档在视觉上与原始PDF高度相似(字体、间距、缩进、页眉页脚等),又要符合Word文档的底层结构规范,确保用户能够顺畅地进行二次编辑,两者往往存在冲突。


    嘉宾
    DACon 2026 · 北京站
    常鸿宇
    360集团 算法资深工程师
    2026-10-24
    16:45-17:30

    金融投研场景多模态数据的治理与 LLM 价值挖掘实践

    演讲介绍:

    基金公司每天沉淀大量研报、公告、路演、舆情、专家访谈等非结构化投研数据,但相比行情、交易、产品等结构化数据,这些数据长期面临来源分散、格式复杂、标准不一、难以统一治理和计算等问题。本分享从数据工程视角出发,介绍多模态投研数据从采集接入、文档解析、内容清洗、统一建模到数据治理的实践,并探索 NLP 与 LLM 如何作为新的语义加工能力,完成实体、事件、观点等信息抽取与语义切片、向量化,逐步将原始文档转化为可治理、可关联、可计算的数据资产。


    演讲提纲:

    1. 基金投研的非结构化数据困境
    2. 从“文件”走向“数据对象”
    3. NLP 与 LLM 如何成为新的“数据处理引擎”
    4. 从文本到“可计算的投研数据资产”
    5. 从数据资产到投研价值:检索与智能应用


    听众收益:

    1.建立多模态数据治理的完整方法论:从研报、公告、路演、舆情、访谈等原始数据接入,到解析、清洗、标准化、建模、质量管理和数据资产化,理解非结构化数据如何真正进入企业数据体系。

    2. 理解 NLP / LLM 在数据工程中的新角色:不把大模型简单理解为“问答工具”,而是将其作为一种新的语义计算与数据加工引擎,与传统 ETL、规则、NLP 和数据仓库结合,完成过去难以自动化的数据处理任务。


    落地挑战和方案重点:

    1. 文档结构保真与切片粒度的矛盾
    2. 金融场景的检索精度与结果可信度


    嘉宾
    DACon 2026 · 北京站
    田继龙
    天弘基金 投研数据湖负责人

    模型+全栈工程才是护城河:从医疗Agent到全行业启示

    DACon 2026 · 北京站
    胡浩源
    京东健康 AI 副总裁 智能算法部&医疗大模型 负责人

    医疗大模型 · AI Agent · 金融 AI · 运筹优化

    个人简介
    长期从事人工智能、大模型与运筹优化的研究及产业落地,具备供应链、金融与医疗领域的技术研发、产品建设和团队管理经验。现负责京东健康智能算法部与医疗大模型,推动京医千询、MedCode、MedWiki 与 MedWork 等模型、技术及产品建设。此前担任蚂蚁金服金融 AI 与金融大模型负责人、菜鸟网络 AI 负责人。

    在 ICML、NeurIPS、Management Science 等国际学术会议与期刊发表论文数十篇,担任 SIGKDD 高级领域主席及 Applied Data Science Track 领域主席,兼任高校研究与教学职务。

    工作经历
    京东健康
    AI 副总裁|智能算法部 & 医疗大模型负责人**
    负责医疗大模型、智能算法与 Agent 技术体系建设,推动模型研发、医学知识、评测体系及产品应用协同发展,服务用户健康管理、医生工作与医院临床流程。

    大模型与核心技术
    - 京医千询 3.0:推动面向复杂医学任务的执行级模型建设,融合医学知识、多模态理解、工具调用与长程任务能力。
    - MedCode:建设医疗可执行推理能力,将指南规则、适用条件、计算与工具操作转化为可运行、可测试、可审计的执行步骤,通过执行反馈提升推理与任务质量。
    - MedWiki:建设结构化医学知识体系,结合 Agentic Search 组织指南、医学概念、证据等级与版本信息,支持主动查证和证据追溯。
    - 原生 3D 与多模态理解:围绕 CT、MRI 等场景,结合医生阅片操作轨迹、影像位置和诊断依据,推进影像理解与交互式阅片能力。
    - 长程任务执行:贯通检索、分析、工具调用与文档生成,建设任务检查点、错误定位和恢复机制。
    - 医学评测:推动 MedEviBench、MedRealMM、Med3DVQA 等联合评测与研究,结合医生审核标准、专业反馈和失败案例,持续优化模型及产品质量。

    产品与应用
    推动统一模型能力在用户、医生和医院场景中的应用,支撑京东健康 AI 产品体系:

    产品 定位
    | 大为医生 | 面向用户的问诊与健康管理服务 |
    | 京东知医 | 面向医生的医学循证检索与专业知识查证 |
    | 小康 | 面向用户的体重管理与健康服务 |
    | MedWork | 面向医生及专业团队的通用 Agent 工作台 |
    | 京东卓医 | 面向医院的工作流辅助 |

    MedWork 平台建设
    - 建设统一 Agent 执行底座、医疗通用能力与场景工作流,组织任务目标、输入资料、工具执行、人工审核及交付物。
    - 覆盖循证检索、病历归纳、门诊辅助、录音辅诊、AI-MDT、临床营养、用药辅助、影像及科研任务。
    - 提供文件与语音输入、云端与本机工作空间、多工具执行、任务沙盒、权限管理与审计能力,支持文档、报告、图表、代码和数据文件交付。
    - 推动医生个体使用与院内工作流落地,将专业能力沉淀为可复用的 Skill、连接器和标准工作流。

    蚂蚁金服
    金融 AI & 金融大模型负责人|财富保险事业群大模型委员会主席
    - 负责金融 AI 与大模型技术及业务应用建设,推动金融专业能力与财富、保险场景结合。
    - 建设 Finix 金融大模型,支撑蚂小财、蚂蚁财富等产品应用。
    - 支持蚂小财达到 3,000 万月活跃用户、蚂蚁财富达到 200 万日活跃用户。

    菜鸟网络 / 阿里巴巴
    菜鸟网络 AI 负责人|阿里巴巴供应链与运筹优化小组副组长
    - 负责 AI 与运筹优化技术在仓储、运输、履行和供应链场景中的应用。
    - 打造 Greed Solver,打破数十项世界纪录,创造十余亿元业务价值,相关工作入围 INFORMS Franz Edelman Award。
    - 获得 2015 年阿里巴巴 CEO 特别贡献奖,参与推动阿里巴巴个性化技术发展。

    学术任职与服务
    - 浙江大学客座研究员。
    - 上海财经大学硕士生导师。
    - 浙江工业大学客座教授。
    - SIGKDD 高级领域主席。
    - SIGKDD Applied Data Science Track 领域主席。

    学术成果与研究方向
    在 ICML、NeurIPS、Management Science 等国际学术会议与期刊发表论文数十篇,研究与应用方向包括:
    - 医疗与金融领域大模型。
    - 可执行推理、代码大模型与执行反馈学习。
    - Agent 任务编排、工具调用与长程任务执行。
    - 医学知识组织、主动检索与循证评测。
    - 多模态理解、三维医学影像与医生操作轨迹。
    - 供应链优化、运筹求解与业务决策。

    荣誉与奖项
    - INFORMS Franz Edelman Award Finalist。
    - INFORMS Daniel H. Wagner 奖。
    - 2024 年吴文俊人工智能科学技术二等奖。
    - 2015 年阿里巴巴 CEO 特别贡献奖。
    - 蚂蚁金服 T-Star 技术大奖。

    开放语义、Ontology 与元数据:Agent Context 的三重支柱

    DACon 2026 · 北京站
    堵俊平
    Datastrato 创始人兼 CEO,Apache Gravitino 项目发起人

    Datastrato 创始人兼 CEO,原 LF AI & Data 基金会董事主席,Apache 软件基金会成员,数据与开源领域专家。曾任全球 500 强企业开源业务总经理、腾讯开源负责人兼大数据研发总监、Cloudera Hadoop 团队负责人等。

    AI 时代,知识与本体的演进与思考 -- 从数据工程到知识工程

    DACon 2026 · 北京站
    关涛
    云器科技 联合创始人&CTO

    2006年,微软亚洲研究院,构建微软第一代分布式KV系统SearchRepository (7000台物理服务器规模)和 Bing搜索的分布式存储后台Kirin Store(4万台规模)。之后加入微软美国云计算和企业事业部,主持和参与开发了包括 Cosmos/Scope(20万台规模),iScope, Azure Datalake


    2016年回国加入阿里云,前阿里云 计算平台事业部 研究员,阿里巴巴通用计算平台负责人,负责阿里巴巴主线大数据平台(飞天MaxCompute,Dataworks,10万+规模)。前阿里和蚂蚁集团技术委员会计算平台领域组长、阿里云架构组大数据组组长。2021年,代表阿里云主持Forrester 云数仓评测,并首次入选全球榜单“卓越表现者象限”。

    2021年,创立云器科技(“基于增量的云湖仓”数据基础设施提供商,yunqi.tech),担任CTO

    17年分布式系统和大数据平台开发经验,并著有多篇国内外会议论文和专利。2018浙江省科技进步一等奖,2021 USENIX ATC best paper award    

    蚂蚁集团金融数据知识本体:让Agent从"会查数"到"懂业务"

    DACon 2026 · 北京站
    崔伟斌
    蚂蚁集团 资深数据技术专家、蚂蚁消费信贷数据负责人

    现任蚂蚁集团资深数据技术专家,长期深耕消费金融、数据架构与数据智能领域。近年来重点探索大模型与数据技术的深度融合,围绕数据智能体、业务本体、智能分析与数据工程智能化开展实践,推动数据能力从传统的数据生产与分析,向“AI理解业务、智能体自主完成数据任务”演进。曾获多项国家专利,并受邀进行多次技术分享。

    从数据资产到可信决策,B2B跨境金融风控的AI产品化实践

    DACon 2026 · 北京站
    陈文松
    XTransfer 高级产品总监

    现任XTransfer高级产品总监, 拥有14年跨行业复杂场景治理经验,具备电信级海量数据与金融级高可靠场景实操背景,深耕企业数字化转型与AI探索。

    翼支付:本体落地对金融可信AI的挑战——语义映射与对象存储的取舍


    DACon 2026 · 北京站
    徐德华
    天翼征信有限公司 总经理助理

    负责企业征信数据产品、企业关系图谱与穿透式监管数据能力体系建设。

    快手 Data Agent 的演进、核心设计与实践

    DACon 2026 · 北京站
    张蕤
    快手 数平产品技术中心负责人

    快手数平产品技术中心负责人,10多年大数据平台系统建设经验,当前专注于 Data Agent、大数据分析与服务平台、大数据开发与治理平台、资产服务平台等大数据中台建设工作

    30 分钟上岗:企业“招聘” Data Agent 的新标准

    DACon 2026 · 北京站
    周卫林
    Aloudata 大应科技 创始人 & CEO

    20 余年大数据领域从业经验,是国内最早一批数据仓库先行者。曾任蚂蚁集团研究员(P10)、蚂蚁集团数据平台部总经理,蚂蚁集团数据技术主要奠基人,推动业务数据化、智能化体系建设和演进。现领导 Aloudata 以 NoETL 语义编织(Semantic Fabric)技术体系,构建 AI 可理解、可操作的数据底座。

    从 BIRD 第三到生产可用:小米 Data Agent 落地实践

    DACon 2026 · 北京站
    方彪
    小米高级算法工程师

    现任小米高级算法工程师,长期深耕 Data+AI 领域。主导落地用户画像、智能分析、数据问答、Data Agent 等数据智能方案,2026 年 5 月 Bird 总榜第三。

    让Agent进入经营决策流程——语义治理、归因诊断与管理研判

    DACon 2026 · 北京站
    钟雨洁
    高德商业智能部 数据分析专家

    多年商业分析与AI应用经验,现任高德AI应用组商业决策架构师。主导多行业智能诊断系统建设,具备Agent/Skills架构、NL2SQL、知识工程与端到端评测经验与能力,撰写《面向复杂业务场景的智能分析 Skills 架构设计与演进》刊登于阿里技术公众号,浏览量破1.3w(Top5)。

    让 Data Agent 的每个回答都有据可查:企业级可信问数的工程闭环

    DACon 2026 · 北京站
    李明皇
    Datastrato 资深软件工程师 / Apache Gravitino PMC Member

    李明皇,Datastrato 资深软件工程师、Apache Gravitino PMC Member,曾在滴滴从事三年大数据引擎研发,现专注企业语义层与 Data Agent。

    从工作流到智能体集群:企业级多租户数字员工的工程化落地与协同实践

    DACon 2026 · 北京站
    何碧宏
    杭州群核信息技术有限公司 SRE团队负责人、软件开发专家

    何碧宏,目前为群核科技SRE团队负责人、软件开发专家、稳定性委员会核心成员,此前担任过监控、可观测及应用团队负责人,有丰富的系统稳定性保障、AIOps实战经验,主导根因分析、故障自愈、故障演练、AIOps等SRE平台建设,企业故障数从三位数降到个位数的亲历者。此前在诺基亚工作十余年,参与过诺基亚 DevOps 平台、网管系统的架构和建设。

    从 Workflow 到数字员工:一个生产级数据分析 Agent 的架构与落地

    DACon 2026 · 北京站
    谢苑珍
    腾讯 高级算法研究员

    高级算法研究员,发表期刊会议(ACL, ICDM, KBS, WSDM, CIKM等)论文 11 篇。近年来专注于大模型在数据分析领域的前沿探索与落地,对 LLM Agent领域有深入研究。

    从单 Case Copilot 到跨 Case Agent Mesh:金融风控 AI 的 A2A 架构与可信落地

    DACon 2026 · 北京站
    董大凡
    Airwallex 空中云汇 架构师

    董大凡,南开大学计算机应用技术博士,大数据、云原生与企业级 AI 系统专家。曾任职于雅虎、微软、亚马逊等头部科技公司,现就职于 Airwallex Risk Team。近年来专注于 AI 在金融风控与合规领域的工程化落地,主导 Airwallex 首个 AI 风控产品从 0 到 1 建设并投入实际业务,持续推动多  Agent 与跨 Case 智能协同在风控系统中的应用。

    几百个数字员工在阿里上岗:Agent Loop框架、MCP双模式与多Agent协同的落地经验


    DACon 2026 · 北京站
    董晓庆
    阿里控股企业智能事业部数字员工负责人

    董晓庆(花名萧庆)高级技术专家,加入阿里巴巴15 年,参与或主导过多个阿里及蚂蚁的顶级开源项目,自2020 年开始专注于阿里巴巴办公产品的研发和架构设计,负责过多款内部高频AI 应用产品,目前是集团数字员工的负责人,构建了数字员工的申请、开通、培训、评测和上岗的全流程,已经有数百个数字员工进入实际应用。

    为所有人构建开放的统一 KVCache 管理层:LMCache 的开源之路


    DACon 2026 · 北京站
    毛宝龙
    LMCache(PyTorch Ecosystem) 维护者 & 核心架构师

    毛宝龙(GitHub ID:maobaolong)是 PyTorch 基金会旗下开源大模型推理 KV 缓存管理层项目 LMCache 的维护者与核心架构师。他累计合并提交 200 余项代码合并请求,为项目第二大贡献者;其工作覆盖跨进程通用引擎服务、零拷贝 KV 数据传输、可插拔二级存储连接器框架、可观测体系以及多硬件厂商兼容适配等核心模块。他致力于打造不绑定特定硬件厂商的中立底层基础设施,并积极引导开源新人完成首次代码提交。

    他曾任职于多家头部互联网企业,包括腾讯、阿里云、京东,深耕 AI 基础设施、大数据存储与分布式缓存领域。

    此外,他也是 vLLM 项目的 Contributor,Alluxio 项目 PMC(项目管理委员会)成员 & Maintainer,同时担任 Apache Ozone 与 Apache Uniffle 的 Committer。他对开源事业抱有极大热忱,长期致力于扩大开源社区影响力,吸引更多开发者参与、落地与使用相关开源项目。

    DACon 2026 · 北京站
    郑春晓
    LMCache(PyTorch Ecosystem) 维护者 & 核心架构师

    PyTorch 基金会开源项目 LMCache 核心维护者。LMCache 是服务于大模型推理的开源 KV 缓存管理层,chunxiaozheng累计提交 100+PR,为项目前五贡献者,主导完成 MLA 适配、DSA 支持、IO 流程优化、CLI 工具实现等关键功能开发。

    PPIO的Token工厂与智能模型网关实践

    DACon 2026 · 北京站
    李星星
    PPIO 研发副总裁

    长期深耕AI云基础设施、模型服务平台与智算产品研发,推动AI算力调度、AI推理平台及Agent基础设施的工程化落地,助力国产模型应用与企业数字化出海。

    敦煌网:从"选最强模型"到"做最优组合"——企业模型路由与治理实践

    DACon 2026 · 北京站
    窦东员
    敦煌网 基础架构部总监

    MBA,二十年IT从老兵,十年外企,十年互联网技术管理经验。

    GR-Inference:小红书搜索生成式召回性能优化实战

    DACon 2026 · 北京站
    骆兆楷
    小红书 模型工程负责人

    2016 年加入 NVIDIA,参与 TensorRT 早期研发。2018 年加入阿里巴巴达摩院 AI Lab,参与自动驾驶计算中台建设。2020 年加入腾讯,从 0 到 1 主导搜广推领域深度学习计算框架的设计与落地;2023 年投入混元 LLM/VLM 训推 AI Infra 研发。2025 年加入小红书,担任模型工程负责人,统筹多模态大模型与搜广推 AI Infra 建设,并推动 hardware-aware co-design 驱动的下一代业务深度学习模型演进。

    从"会查数"到"懂业务"——奇虎360 企业级 Data Agent 的语义层演进与量化评测实践

    DACon 2026 · 北京站
    郭朝阳
    奇虎360科技 数据开发专家

    长期深耕大数据平台建设与BI分析方向,目前主要负责360智汇云湖仓数据应用平台的架构设计与核心研发,同时也是湖仓 Data Agent 化演进的技术负责人。工作重心围绕一条主线展开——如何让大模型的语义理解能力真正"落进"数据平台:从 NL2SQL 的准确率保障,到语义层的渐进式构建,再到分层架构下的工程化落地。持续关注 LLM 与湖仓能力的结合点,尤其是如何在确定性编译引擎与模型推理之间找到正确的分层边界,让数据智能从"能用"走到"敢用"。

    AI-Native 数据语义平台建设思路

    DACon 2026 · 北京站
    苗治勇
    懂车帝 数据仓库负责人

    目前在懂车帝担任数据仓库负责人,之前在百度等公司有多年互联网工作经验

    Apache Ossie 语义层在蚂蚁的落地实践

    DACon 2026 · 北京站
    王小军
    蚂蚁集团 蚂蚁数据语义层平台负责人

    从 2020 开始,在蚂蚁数智平台先后参与负责了以下项目:

    数据建模:参与基于 OneData 方法论的规范建模项目,负责其中核心的 OneData 逻辑查询引擎建设;

    资产语义层:负责蚂蚁资产语义层的建设,包含业务词条、概念模型、指标语义层、指标翻译引擎等;

    资产智能化:负责蚂蚁资产知识库、资产智能化服务、资产智能化应用等能力,广泛应用于企业内部各个场景,为各类智能化应用场景提供高质量的、可信的上下文。

    26年,引入业界开源 OSI 协议,负责 AI 智能化爆发背景下的面向 Agent 的蚂蚁语义平台建设。


    小红书:相关性vs收入不必二选一——Agent重构搜索分发引擎

    DACon 2026 · 北京站
    王鹤达
    小红书 搜索广告算法负责人

    小红书广告搜索算法团队负责人,此前为小红书社区算法团队核心成员。

    广告搜索算法团队是商业化最核心的技术团队之一,掌握着亿级商业预算分配,负责小红书的搜索变现——让合适的品牌出现在合适的位置。

    现在行业正从"关键词匹配"往"Agentic 意图匹配"转型,我们团队正在用 LLM + Agent 重构广告分发逻辑,也在同步构建端到端生成式广告的新产品。


    高德路线推荐从工业引擎到大模型Agent的范式跃迁

    DACon 2026 · 北京站
    陈超
    高德 路线推荐核心算法负责人

    陈超,2019年加入高德地图,至今7年专注路线推荐算法,现为路线推荐核心算法负责人。主导构建行业首个全场景统一路线推荐架构RouteMind,覆盖驾车、货车、公交、骑行等全场景,服务QPS 10万+。相关落地技术成果在KDD、WWW、Recsys、CIKM等顶会发表多篇论文。


    从隐式推荐到交互式陪伴 —— 推荐系统的智能跃迁

    DACon 2026 · 北京站
    吴喆
    腾讯音乐娱乐集团 互动视频推荐、创新推荐负责人

    毕业于中山大学与香港科技大学,当前是TME互动视频推荐、创新推荐负责人,近期围绕生成式推荐与交互式推荐做了产品化落地,且其中部分工作已被CIKM2026接收。

    从"答得对"到"看得透" —— 高德智能问数产品,从BI底座到Agent底座迭代之路

    DACon 2026 · 北京站
    林宇航
    高德商业智能部 数据产品专家

    职场履历覆盖头部外企、头部消费品牌等近10年的数据产品,主导企业内的多款数据产品的选型、落地与迭代,多次参与企业内外hackathon并获得头部名次。

    从多云底座到 AgentReady:企业 DataAgent 架构升级与高端零售行业落地实践

    DACon 2026 · 北京站
    谈总
    某全球头部奢侈品厂商 大数据负责人

    某全球头部奢侈品厂商亚太大数据负责人,负责亚太区数据与技术战略,拥有奢侈品全球化多品牌多云数智基座建设经验,主导集团多云数据平台落地

    DACon 2026 · 北京站
    原攀峰
    数新智能 CTO

    北京航空航天大学计算机硕士,十余年大数据、隐私计算的行业研发经验,国内外发明专利20篇。前阿里巴巴集团大数据平台高级技术专家,阿里御膳房、阿里云数加、DataWorks创始团队核心领导,0-1完成阿里云隐私计算平台DataTrust产品研发及商业化落地。

    OPPO:从存算分离到Agent数据底座——Curvine的端云协同架构实践


    DACon 2026 · 北京站
    付庆午
    OPPO 数据平台部大数据架构师

    目前在OPPO数据架构组负责架构演进研发;Spark 开源RSS项目Shuttle发起人;Curvine高性能分布式缓存开源项目发起人;曾供职去哪儿网大数据,阿里云MC团队。

    从TDD到EDD:评测驱动的Data Agent开发范式

    DACon 2026 · 北京站
    荣柯柯
    高德商业智能部 数据技术专家

    荣柯柯(花名 柯俊),阿里巴巴数据技术专家,深耕数仓与 dataagent评测领域。主导 Data Agent 智能问数评测平台建设,构建四维评测体系与自动化评测 CI,精通 NL2SQL 评测、MaxCompute/AnalyticDB/Flink/SR 大数据栈及 Python/React 全栈开发。

    构建高交付质量的垂类AI Agent:业务真实的Benchmark做部署时对齐,兑现率做成工程对象

    DACon 2026 · 北京站
    王旭
    科锐国际 高级专家兼MiraDay 技术负责人

    15年技术从业经验,经历过PC互联网、移动互联网,正在推动AI Native组织的转型

    曾任职于唯品会、万达网络、美团

    现在科锐国际担任高级技术专家 兼 MiraDay 技术负责人


    Agent 评测如何落地:可信标准与双 Loop 演进实践

    DACon 2026 · 北京站
    高诗梦
    美团 专家工程师

    毕业于电子科技大学,负责美团Agent评测平台建设。

    给模型立规矩:业务 Agent 的三重约束——角色 · 知识 · 动作(以营销策略 Agent 与数据分析 Agent 为例)

    DACon 2026 · 北京站
    孟垂实
    京东科技集团 算法总监

    京东科技总监、京东智能城市研究院高级研究员,副高级工程师。2018年获纽约州立大学布法罗分校计算机科学博士学位,长期从事机器学习、数据挖掘与智能agent研究及工程实践。获2021年北京科技新星、北京市经开区优秀人才,任中国计算机学会人工智能专委会执行委员,在KDD、SenSys、SIGSPATIAL、UbiComp等国际会议和期刊发表论文20余篇,被引1700余次。主导南通、大同、南京、上海普陀等地城市数字基础设施建设,负责智能研判、智能营销等垂类业务agent的产品设计与研发。

    从 Harness 到后训练:以 GUI 测试执行 Agent 为例的领域agent优化实践

    DACon 2026 · 北京站
    詹伶俐
    江苏润和软件股份有限公司 技术专家

    润和软件AI技术中心技术专家,南京大学工学博士学位,紫金山英才,2021年江苏省双创博士。博士期间从事计算机视觉、深度神经网络算子与网络结构、对抗生成深度神经网络等方向的研究。参与过:全军后勤系统“十二五”重大专项,裸眼立体视窗系统;装备预先研究计划,激光三维成像系统;国防工程配套项目,基于增量式深度学习系统的态势感知等。2020年-2023年,主导研发“基于云大智的下一代空管系统-NUMAN 5000”的智能化研发。2023年至今,主要负责润和AI相关产品研发,深耕垂类大模型、面向金融领域的RAG系统,面向测试领域的GUI agent,以及智能体平台基础框架研究。相关研究成果转化为发明专利10+篇:“一种端到端软件操作智能体的强化学习系统与方法”,"一种面向大模型在线学习的轨迹感知策略优化方法"、面向大型软件系统开发智能体的"一种基于双层动态索引的智能体记忆系统"等。

    从外购到自研,从向量RAG到Agentic语音智能体——企业对话机器人的完整演进之路

    DACon 2026 · 北京站
    武文斌
    小赢科技 模型应用开发负责人

    小嬴科技AI应用研发负责人,负责公司多款AI应用落地,覆盖营销、客服、资金、贷后等多个业务场景。带领团队完成多款检索、推荐、辅助、质检和智能问答类产品的研发。目前主要聚焦在垂直领域对话机器人方向的研发工作。

    高德营销补贴ROI评估:从人工一次性到可信决策引擎

    DACon 2026 · 北京站
    许晓巍
    高德 数据技术高级专家

    从对话式问数到组织级数据工作空间:京东广告数据分析 Agent 的工程化实践

    DACon 2026 · 北京站
    吴旭晶
    京东集团 京东零售算法工程师

    京东零售广告数据分析 Agent 核心设计与开发者,长期关注自然语言问数、自动化报告和 Agent 工程化落地。当前主要负责京东广告数据分析 Agent 的能力设计与核心研发,覆盖智能问数、报告生成、订阅推送、异常归因、图执行和数据工作空间等方向。

    本体驱动的Agent实践——从查数、分析到销售决策

    DACon 2026 · 北京站
    梁伟
    理想汽车 高级算法工程师

    数据智能部门负责人。长期参与智能问数、Data Agent与企业数据本体方向的技术探索,拥有从模型后训练到数据智能应用落地的实践经验。

    基于本体的领域知识工程实践:以金融测试为例

    DACon 2026 · 北京站
    杨冬瑞
    江苏润和软件股份有限公司 人工智能中心 AI架构师

    东南大学博士毕业,曾就职于华为2012实验室,主导众核系统性能分析平台建设、AI辅助模型驱动开发工具开发、嵌入式agent开发等,曾获创新与技术突破奖,南京研究所十佳品质提升实践等。现就职于润和软件,主导基于本体的AI测试平台的开发和实践。

    从洞察到行动:企业 Data Agent 的闭环架构与工程实践

    DACon 2026 · 北京站
    王浩强
    ThinkingAI Agent 首席架构师

    专注企业级 AI Agent 的技术架构与落地应用,推动数据分析、多 Agent 协作与业务执行融合,让数据洞察转化为可衡量的业务价值。

    从 DataAgent 到行动闭环的 Agent 决策执行实践

    DACon 2026 · 北京站
    王林红
    易车 数据平台负责人

    长期深耕大数据与 AI 领域,曾主导多家公司大数据平台、数据中台从 0 到 1 建设。AI 时代,负责企业级 AI Agent 体系规划及落地,推动数据、语义、知识与执行能力平台化,推动企业数据从支撑分析走向支撑决策执行,构建人机协同的数据决策新范式。

    知乎 DataClaw:从 MetricFlow 到 AI 原生语义层的演进实践

    DACon 2026 · 北京站
    汤晋瑄
    知乎 数据平台工程师

    10余年大数据平台与实验平台一线开发经验,熟悉主流大数据技术栈,深知数据团队业务痛点。负责知乎 Data Agent 系统的架构设计与开发,致力于用 AI 技术提升数据团队生产效率。

    京东B端Agent的上下文工程实践:多层动态Memory让Agent越用越懂用户

    DACon 2026 · 北京站
    辜立忠
    京东 零售算法工程师

    主导 DataAgent、B端超级助手、大数据 Copilot 等零售 B 端多个智能体项目从 0 到 1 构建与规模化演进,深耕多业务工具调用、多层级智能体架构、Memory 飞轮与长任务生产化,在 OxyGent 框架上沉淀了一整套 B 端 Agent 长期化生产的工程范式。

    从 BI 到决策智能:DecideX 的上下文工程、证据链与评估闭环

    DACon 2026 · 北京站
    石凯
    观远数据 产品专家

    数据领域资深产品专家,拥有10年以上行业经验,关注企业数据资产建设与决策知识的沉淀和复用,探索通过上下文工程与AI应用,推动企业从BI分析走向可解释、可评估的经营决策。

    语义层即上下文:理想汽车生产级 Agent 的语义工程实践


    DACon 2026 · 北京站
    钱瀚
    理想汽车 大数据平台负责人

    拥有十余年分布式大数据与AI基础设施建设经验,先后任职搜狗、百度、京东、字节跳动,现于理想汽车负责大数据平台。主导理想汽车大数据云原生、实时数据湖、元数据与语义层技术落地,服务百万级车辆大数据场景,承载万亿级车辆信号处理。

    构建知识工程,推进高质量Agent分析决策

    DACon 2026 · 北京站
    赵雪波(元甲)
    马上消费金融 大数据总监

    互联网公司数据团队10+年工作经验,电商双11可视化直播大屏最早的建设者,互联网流量采集和计算标准最早建设者

    金融行业4年从业经验,建立时序、快照、标签等面向模型决策的复合用户数据资产


    Skill 与 Agent 的边界:数据平台的分层架构实践

    DACon 2026 · 北京站
    郭志浩
    瓴岳信息(洋钱罐)数据平台数据应用负责人

    长期深耕数据平台与 AI 基础设施方向,当前主导金融场景下数据应用平台的 Agent 化架构设计与演进,负责探索分析、归因分析、数据洞察、SQL 生成等场景 Agent 及底层 Skill 体系、标签系统的规划与落地。关注 LLM 与数据平台融合中的能力抽象、分层架构与工程化取舍。

    从需求澄清、AI Coding、AI Testing 到 Notebook 分析:得物 Agent Harness 贯穿数据研发全链路的落地实践

    DACon 2026 · 北京站
    林风
    得物 技术专家

    本科毕业于大连理工大学、硕士毕业于同济大学,毕业后在网易、得物从事数据平台研发和AI Agent探索工作

    AI Native数据操作系统

    DACon 2026 · 北京站
    legend
    京东 技术负责人

    毕业于北京大学,先后供职于多家互联网大厂,涉及到计算引擎、服务架构、广告平台、数仓及数据平台、Data+AI;深耕数据领域多年

    从数据到决策:用户增长本体论 UGO —— 京东零售用户运营技术团队的探索

    DACon 2026 · 北京站
    周默
    京东集团 算法总监

    京东零售平台营销中心用户运营部算法总监,京东集团11年工作经历,历任京东商城技术中台基础算法部负责人、京东零售用户增长与运营部技术团队负责人、京东零售产研中心技术架构部算法总监,现任京东零售营销中心用户运营部首席架构师,拥有丰富的高可用工程架构以及算法驱动业务应用落地的实战经验,曾获北京市亦城优秀人才、京东集团优秀人才、京东集团算法大牛、最美京东人、京东零售十大最具影响力专家等称号。目前清华MBA在读,担任清华经管产业创新俱乐部主席,对AI时代下的技术战略布局及团队管理有独到见解。

    自进化数据智能体:迈向 Data–Ontology–Agent 协同进化

    DACon 2026 · 北京站
    张绍磊 博士
    中国人民大学 助理教授

    于中国科学院计算技术研究所获得博士学位。他的研究方向涵盖大语言模型、多模态大模型、AI for Data Science。相关研究成果在 NeurIPS、ACL、ICLR 等国际人工智能与自然语言处理会议发表论文30余篇,开源的多语言大模型、多模态大模型、数据科学大模型在 GitHub 社区累计获得7000+星标。他长期担任 CCF-A 类国际会议 ACL ARR 的领域主席和责任编辑。个人主页:zhangshaolei1998@github.io。

    Shopee:基于图平台的反欺诈本体建模与智能决策实践

    DACon 2026 · 北京站
    张松清
    Shopee 图平台负责人

    深耕图存储与图计算图学习研发。2018 年起参与蚂蚁集团自研图存储系统从 0 到 1 建设,发表图数据专利2篇,后参与阿里搜索索引统一存储层研发。
    现负责 Shopee 图平台开发,覆盖图数据库、图计算与图学习服务以及一站式的图平台。

    ZTE:基于Harness Engineering驱动的全栈智能体交付实践


    DACon 2026 · 北京站
    路芳芳
    中兴 研发改进负责人

    部门改进负责人,负责推进AI提效策略在项目的落地,辅助项目达成效能提升目标

    百度:研发角色融合下的一站式产研平台实践


    DACon 2026 · 北京站
    孟小萱
    百度 资深工程师

    孟小萱,百度资深工程师,当前就任担任AI效能创新平台相关工作,致力于通过平台化、基建化的形态,通过AI赋能业务研发提效,并同时推动平台建设和实践落地工作。

    从个人提效到组织跃迁:AI时代的研发管理实践

    DACon 2026 · 北京站
    李庆丰
    新浪微博 高级总监

    负责新浪微博基础架构和流媒体等研发方向。在高可用架构、视频、直播等技术方向有丰富的研发实战及管理经验。同时作为微博技术新兵训练营负责人,主导技术新人技术融入提升培训体系。

    NL2Pipeline:让 AI-Ready 数据处理走向自动化


    DACon 2026 · 北京站
    强美伊
    北京大学 DCAI 实验室研究助理 &元枢智汇联合创始人

    OpenDCAI 系列开源项目核心技术开发者,重点参与 AI 数据准备系统 DataFlow(GitHub 7.2K stars)与动态训练系统 DataFlex (GitHub 1.9K stars)的研发与落地,研究方向涵盖 Data-Centric AI、数据—模型协同训练与动态数据优化等。OpenDCAI开源生态累计获得GitHub万余颗Star,个人累计发表CCF-A类期刊及会议论文 7 篇,曾获国家奖学金及第十五届“尖烽时刻”商业模拟大赛全国总冠军等荣誉。现作为元枢智汇联合创始人,负责AI数据基础设施的技术产品化、解决方案设计与商业落地,推动 DataFlow、DataFlex 等技术从开源研发走向工程交付与行业应用。

    企查查:表格识别、VLM幻觉修正与文档解析加速的工程实践

    DACon 2026 · 北京站
    陈汝龙
    企查查 数据部AI负责人

    企查查数据部AI负责人,互联网行业从业12年,深耕算法、架构、云原生与工程应用,主要负责企查查业务线中的智能化数据治理。

    非结构化文档的内容理解与样式还原——从RAG知识供给到PDF转Docx的工程实践

    DACon 2026 · 北京站
    常鸿宇
    360集团 算法资深工程师

    360人工智能研究院算法资深工程师。硕士毕业于北京理工大学,从事NLP及相关领域研究6年,主要研究方向为信息抽取,多模态内容理解,非结构化文档解析。

    金融投研场景多模态数据的治理与 LLM 价值挖掘实践

    DACon 2026 · 北京站
    田继龙
    天弘基金 投研数据湖负责人

    天弘基金公司投研数据湖负责人,主导公司从传统结构化数仓向多模态数据湖演进,构建覆盖研报、公告、路演音频等场景的数据治理体系,并探索LLM在投研数据挖掘中的工程化落地。

    共创伙伴
    主办方
    DACon 2026 · 北京站
    指导单位
    DACon 2026 · 北京站
    钻石展商
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    铂金展商
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    黄金展商
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    DACon 2026 · 北京站
    活动主办方