中国国际服务贸易交易会第八届中国金融科技论坛于9月9日在北京举行,主题为“科技赋能—金融业数字化创新与应用”。北京词元无限科技有限公司CEO杨萍出席并演讲。
以下为演讲实录:
杨萍:各位领导、各位专家,大家下午好,我是词元无限的代表,我今天给大家分享的题目是《以数字劳动力重构金融企业研发生产力》,金融企业目前整个的AI在研发的实践,我们认为其实也是从过去的助手工具型慢慢的走向了下一个阶段,就是我们逐渐走向数字劳动力。
今天我想跟大家重点讨论的是如何让数字劳动力安全的进入生产,并且能够把AI的能力转换成企业可以衡量的交互结果,接下来我将结合词元无限的产品和三个具体的案例和各位介绍。
先简单介绍一下词元无限,我们是一家企业级 AI Agent 基础设施服务商,我们围绕模型资源、研发智能体、过程治理和结果运营,提供贯穿整个研发流程的智能体和数字劳动力。我们在去年底也推出了Coding Agent产品,一方面它已经进入到了数十家金融核心系统的研发生产产线。另外我们也在国际权威的SWE-Bench Verified 上取得过 79.4% 的 Pass@1的成绩,我们也希望能够把整个模型的能力转化成企业需要的交付能力,具体效果后面也将通过案例为各位带来介绍。
我们的核心主张是企业需要拥有自己的主权Agent,具体来说企业能够自主选择模型的部署方式,掌握数据、知识与流程并且把项目经验和交付反馈持续沉淀成企业所拥有的知识资产,对金融企业而言,这也意味着智能体既要符合当前企业现有的系统,同时也要接受企业对于权限管理、安全审计和质量要求各方面的约束。为什么是今天来讨论这件事情,金融机构整个的应用实践我们看到也逐步的从过去的工具型、助手型,逐渐迈入了整个研发流程和更深入的阶段,也在探索如何兼顾创新与安全。
从行业实践来看中国银行的智能研发助手已经拥有超过万人使用的规模,中国平安披露的2026年第一季度的AI 代码渗透率达到 40%,其实也在整个集团内带来非常广泛的应用,同时交通银行的BocomCode已贯通需求生成、代码生成、代码审查和 SIT 测试环节。这些实践说明,整个应用已经从单点的使用迈向更大范围的流程的部署,随着整个使用范围的扩大,模型、工具、权限和成本如何统一管理,逐渐成为企业需要去解决和回答的问题。
我们认为AI要进入到企业,特别是金融企业,它有四个能力需要去重点关注。第一个是我们要去关注整个能力的安全落地,当前整个智能体,包括模型各种服务的能力,我们可以看到不管是国际还是国内都有非常多目前的安全问题涌现,整个核心的代码其实是企业赖以生存的资产。那么核心代码和敏感数据需要有明确的边界,在部署、访问和审计的链路上都得能够和AI有更好的结合。
第二个是业务理解,就像刚才提到的金融不管是业务层还是核心系统,它面对的都是超长多模态的Context,那么模型在这样的一个基础上,其实它擅长的长程上下文的能力发挥是受到限制的,金融行业的整个系统积累多年,架构依赖,还有业务规则非常复杂,智能体需要理解企业的真实代码和复杂的长程上下文。
第三个是可信交付,生成代码过后,还需要经过评审测试和发布,需要保留整个过程中所有的记录,保留质量证据与责任记录,以便审计追溯。
第四个是规模运营,生成代码之后,正式的评审、测试和验证,它需要有人来做整个环节上关键的把控。规模运营也是企业需要去看到的,企业需要持续看清效率、质量和成本,才能判断我们当前企业投入的AI,不管是消耗的Token,还是模型采购的成本,是否是有效的,并且下一步如何扩大这一块的应用。
今天我们想要去提出的是金融企业需要一整套的数字劳动力生产体系,它需要包含5个方面的能力:能接入、能理解、会协同、可验证和能运营,它能够把整个的模型资源、智能体任务和交付结果串联起来,让工具带来效率的提升,并且能够落实到整个研发组织的交付中。
下面我将介绍一下数字生产体系如何使用。这一页我们可以看一下整个的全景,重点是各个环节如何去协同,整个环节的分布,我们也是结合软件工程中对复杂度的管理,以及当前open engineer对工程这一块任务的拆解。那么需求进入之后,通过架构师的Agent DeepMap来理解企业现有的代码、业务的知识和长程的Context来明确依赖和影响范围,还有开发意图。第二是通过Coding Agent来完成整个代码的生产,还有相应的变更。其次,我们通过不断的做测试和验证来完成整个系统质量的把控。最后再去连接整个发布和运维,更底层是我们共享了一整套的知识底座和Trace系统。其实我们整个测试结果、运维监控,还有交付反馈也会持续回流,沉淀为项目知识、组织规范与交付反馈,推动多智能体协作进化。
整个的改进和后续的任务,包括在安全和质量也是贯穿了整个环节,同时整个过程中的日志,包括整个过程中提到的协作过程都是可追溯的。通过这套协作方式,我们希望能够让数字劳动力承接连续和长程的研发任务,并且在企业既有的流程中接受检验。
当前每一个企业在构建自己的模型体系中,既有自己在自己的算力中去部署的私有的模型,同时也有依赖于外部的SaaS或者API的模型资源,我们认为数字劳动力有另外一个很重要的维度,就是我们一定要去管住数字劳动力对于成本的消耗,那么词元肯定是其中非常重要的一项。支撑这一整套流程,我们其实是希望通过统一的纳管来把整个模型资源在每个环节中的使用,来变成能够串联的过程。
应用环节和场景中,每一个的用量和成本都能够去审计到,为企业去做后面的费用分担和持续的优化也提供了基础的依据。模型接入之后,企业还需要去知道怎么去用?用在哪里?消耗多少?是否符合整个管理的要求。
当前企业也已经采购或者使用、体验过非常多种类的AI工具,比如说以Coding Agent为例,大多数企业至少从用过10种以上的各种Coding Agent的产品,员工也有自己各种的习惯。从企业的角度如何去纳管整个员工的使用习惯,同时又能够在整个公司层面形成统一的治理。我们的思路是把工具和底层的算力来做解耦,尽量能够让员工保留上层工具选择的习惯,同时也通过底层网关和模型的接入来达到整个配额,还有审计这块的要求。也结合企业在安全分区和部署层面的需求,让核心代码和敏感数据在相应的边界内处理,这个也非常重要,降低工具带来的整个的培训和学习的成本,这样企业才能够从过去让员工自由的选择工具到现在有规模的去使用和扩大,并且能够在整个的研发环境上形成规模化的效应。
另外,我们认为数字劳动力进入到企业场景过后,一定要有更加符合AI Native时代的评价体系。我们是把整个度量体系分成了三层:
第一层,在业务层面要去看整个交付周期,产出和结果对应的成本。
第二层,过程指标,我们希望看到整个采用程度、效率提升和知识沉淀的维度。
第三层,底线指标,我们需要去关注的是质量、治理与成本约束。我们看到管理层、团队的负责人、工程师,我们可以在同样的指标体系上看到各自关注的问题,通过整个持续的度量,企业才能够判断哪些场景是值得加大对AI这一块的投入,加大对词元的采买,哪些环节有可能还在比较早期的阶段,还需要有更多的改进。
下面我们将一起看三个例子:
例子一:神州信息。
这个场景是神州信息银行核心系统的研发,这类系统大家可以看到,像各位专家讲的那样,它其实是属于整个系统超复杂,它的关联度、规范严、变更风险高,也是属于传统的各种Coding工具型的产品不太敢碰,并且很难进入的场景。我们会看到这类银行核心系统整个代码生产和要求,其实对于普通的Coding工具来讲是比较有挑战的,对于生成代码的质量要求也极高,我们的Coding Agent进入到这个项目当中,我们是先去理解了整个核心系统,包括神州信息它的整个系统的约束,还有研发规范,然后再通过异步的方式去做大规模的生成,同时也通过对抗式的验证和检验来保持质量的基线。整个项目是采用了零组织的侵入、零流程的改造的模式来协助神州信息去完成的。整个案例中,我们会看到,通过整个Agent的使用,金融业务的交付效率综合提升约40%,IT整个的成本节省约20%。这个案例体现的是数字劳动力或者说良好设计的数字劳动力是可以进入到超大规模和超复杂的银行系统的研发流水线中的。
例子二:某城商行
这个案例重点要解决的是城商行过去历史代码多,但是文档跟代码两层皮的问题。整个代码的迭代是跑得比较快的,但是文档和沉淀体系是没有响应的跟上,整个系统的理解和后续的维护成本也随之增加。我们通过提供架构师Agent对整个代码仓进行了扫描和分析,自动生成了系统的结构描述的说明书和各种相应的文档,并且我们也支持整个的代码变更和文档更新同步来做。整个项目文档生成效率提升 90%,文档覆盖率达到 95%,这些文档也成为后面Coding Agent使用的基础。
例子三:某外资银行
这个项目特点是周期短、人力少,并且也需要有更多的成本这一块压缩的空间的考虑。我们也是通过我们对于整个流程中,不管是从架构分析,还是从代码生成以及最后的测试,整个环节实现了“人+智能体团队”协同来做交付的效果。基本上我们可以看到整个的人天,从过去预估的550到人天,缩减了约20%,降至约400个人天,这个也是非常可观的数据。
这三个案例分别对应的是核心开发、知识沉淀和协同交互,也说明数字劳动力在具体场景中是能够逐步去进入金融这样的超复杂的企业的研发体系的。
今天我们在讨论金融企业整个AI的应用和转型过程中,也会依托于国产化算力逐步的替代。词元无限支持全栈的国产化和私有化部署,并且我们也是能够去针对企业比较顾虑的存量和数据隐私的问题提供对应的解决方案和能力。
当前我们也分别与国内的主流的硬件厂商有分别的集成方案,也欢迎各位可以去了解。
最后回到今天的主题,我们认为当前金融企业类整个AI的应用普及,我们认为是到了用数字劳动力来重构整个金融企业研发生产力的阶段。词元无限也提供贯穿研测和交付全链路的自主的数字劳动力,希望让能力沉淀在企业内部,用交付效率、质量和成本来衡量效果,也欢迎大家来词元无限的展台上进行进一步的交流。
谢谢大家!