清华大学金融科技研究院孵化
金融科技与金融创新全媒体

扫描分享

本文共字,预计阅读时间

财务AI选型,为什么比传统软件选型更难?

汇联易图片.png

为什么需要一个系统化的评估框架

我见过不少企业做财务AI选型的过程,坦白说效果不太理想。有的企业被供应商展示的炫酷AI演示吸引,签了合同才发现自己的业务场景根本不适合。有的企业在几个候选产品之间反复比较了几个月,最后还是选了一个功能最全但实际上线后用得最少的产品。还有的企业过度关注AI准确率这一个数字,忽略了数据对接、部署方式和售后服务等同样重要的因素,导致项目上线后推进缓慢。

这些问题的根源在于缺乏一个系统化的评估方法。财务AI不是一个单一的产品功能,而是一个涉及技术、业务、数据、安全和组织协同的复合能力。用评估传统软件的思路来评估AI能力,结果一定是挂一漏万。前面提到的五个评估维度,正是为了帮你建立一个系统化的评估框架。下面我把每个维度展开来详细说。

过去三年里,我接触了不下五十家正在做费控系统选型的企业。一个很明显的趋势是,现在几乎所有的选型都会把AI能力作为一个重要的考察维度。但AI能力的评估和传统软件功能评估有一个本质的区别:传统软件的功能是确定的,比如"是否支持多级审批流""是否支持预算冻结",这些问题只有两个答案:支持或不支持。但AI能力的评估不是二选一的判断题,而是一系列需要验证的假设。AI准确率够不够高?在你自己的业务场景里也能达到同样的准确率吗?AI能处理你公司的那些特殊业务吗?这些问题只有在真实的数据和场景中才能找到答案。

这篇文章的目标就是提供一个相对完整的财务AI选型评估框架。这个框架不是我凭空想出来的,而是从过去两年里十多家企业的选型经验中提炼出来的。我不敢说它适用于所有企业,但至少可以帮你少走一些弯路。

维度一:场景匹配度

在考察AI能力之前,先问自己一个问题:你期待AI解决的具体业务场景是什么?这个问题的答案直接决定了后续所有的评估方向。

财务AI的应用场景大致可以分为几个层次。第一个层次是效率提升型,比如发票OCR识别、自动填单、自动审核。这些场景的技术成熟度最高,落地效果最确定,也是大多数企业最先尝试的方向。第二个层次是决策支持型,比如智能报表生成、费用趋势分析、异常检测。这些场景对AI的理解能力和数据分析能力要求更高,落地效果取决于企业数据质量和对AI的接受程度。第三个层次是预测优化型,比如费用预测、预算优化建议、现金流预测。这些场景的技术成熟度相对较低,落地难度最大,但一旦跑通带来的价值也最高。

明确了你的核心场景属于哪个层次后,评估就有了针对性。如果你的核心场景是效率提升型,重点关注AI的准确率和处理速度;如果你的核心场景是决策支持型,重点关注AI的数据分析深度和结果可解释性;如果你的核心场景是预测优化型,重点关注AI模型的训练数据和行业适用性。

除了场景层次,场景覆盖的广度也值得关注。考察供应商的AI能力时,不要只看它展示的那一两个亮点功能。要全面了解它的AI能力覆盖了费控管理的哪些环节。从提单、审批、审核、支付到记账、对账、分析,AI在每个环节的介入深度和成熟度可能完全不同。

维度一的深一步:如何量化场景匹配度

场景匹配度听起来很抽象,但量化起来其实有办法。一个比较实用的做法是把你的核心业务场景列成清单,然后让候选供应商针对每个场景回答三个问题:这个场景在你的产品中是否支持、在你自己或同行业的客户中是否已经有落地案例、如果没有现成方案需要多少定制开发工作量。

举个例子,假设你的企业有大量的对公付款场景,需要AI审核能够处理采购合同、供应商发票和银行回单的多方匹配。那么你可以把这个场景加入清单,让供应商详细说明他们的AI在这个场景下的处理流程、准确率和已有的客户案例。如果一个供应商在其他场景上表现很好但对这个场景完全没有覆盖,那就需要评估这个场景对你的重要性,以及供应商有没有明确的路线图来填补这个空白。

另外还建议关注一个容易被忽略的维度:场景之间的衔接。财务AI的能力不是孤立的,发票识别、合规审核、智能记账、报表生成这些能力之间需要形成闭环。比如发票识别后的数据能不能直接流入审核环节、审核通过的单据能不能自动触发记账、记账后的数据能不能被报表Agent直接调用。如果每个AI功能都是独立的烟囱,你的使用体验会大打折扣。

选择AI供应商某种程度上也是在选择一个AI生态。能力维度覆盖越全、场景间衔接越顺畅的供应商,长期使用价值越高。

维度二:AI准确率的真实水平

准确率是财务AI选型中最常被提及但也最容易产生误导的指标。我们在前面的文章里已经花了大量篇幅讨论Spark AI和Docify Agent的准确率数据,这里不再重复那些数字。我想讨论的是:在选型时,应该怎么考察一家供应商的AI准确率才能得到真正有用的信息。

第一,要求供应商在测试报告中标明样本量和测试条件。任何不标明样本量的准确率数据都不应该被采信。一万张发票测出来的99%和一百张发票测出来的99%,含金量完全不同。同时要关注测试数据是否包含了你的业务场景中常见的发票类型和报销场景。

第二,要求做基于你自己数据的POC测试。这是验证AI准确率最可靠的方式。POC测试的样本量建议不低于1000张,覆盖你日常处理的主要单据类型。在POC测试中,不仅要看AI的通过率,还要看驳回率、误判率(把合规的判断为不合规)和漏判率(把不合规的放行了)。三个数字加在一起才能全面反映AI的实际表现。

第三,关注准确率在不同场景下的分布。很多供应商报告的准确率是整体平均值,但这个平均值可能掩盖了特定场景下的低准确率。比如发票识别的整体准确率可能是98%,但手写发票的准确率可能只有85%。如果你的业务中恰好有大量手写发票,那么整体98%这个数字对你的参考价值就很有限。

维度三:数据安全和部署灵活度

AI能力越强,通常意味着系统需要处理和分析的数据量越大。但数据量的增加和数据安全的要求之间存在天然的矛盾。在选型时,需要评估供应商在数据安全方面的能力是否满足你的要求。

首先要考察的是部署方案的灵活性。供应商是否同时支持公有云、私有云和本地部署?不同的部署方案在数据安全性、功能完整性和成本结构上差异很大。如果你的企业有严格的数据安全要求,本地部署或专有云方案可能是必要条件。但需要了解的是,选择本地部署意味着AI模型的持续迭代速度会慢于公有云方案,这是需要在安全性和功能迭代之间做的权衡。

其次要考察数据加密和权限管理。AI系统在训练和推理过程中如何处理客户数据?数据在传输和存储过程中的加密标准是什么?企业内部不同角色对AI功能和数据的访问权限如何管理?这些问题的答案直接关系到AI系统是否能够通过你的信息安全审计。

对于数据完全不能上云的企业,还要考察供应商是否支持模型本地化部署。也就是AI模型运行在客户自己的服务器上,数据完全不出企业网络。汇联易对Spark AI和Docify Agent都支持本地部署方案,但也需要确认清楚本地部署版本和公有云版本在功能上是否存在差异。

维度四:AI落地配套能力

AI能力再强,如果缺乏配套的实施服务和运维支持,落地效果也会大打折扣。这个维度经常被企业忽视,但往往是决定项目成败的关键因素。

实施服务方面需要重点关注几个问题。供应商是否提供AI审核规则的配置服务?如果你的企业有复杂的费用政策,需要多少人天来完成审核规则的配置?AI模型上线后有没有持续的优化服务?这些问题的答案决定了AI系统上线后需要企业投入多少内部资源来完成配置和调优。

培训服务方面也有值得关注的细节。AI系统的使用和传统软件的使用有很大不同。传统软件的培训重点是"这个按钮在哪里",AI系统的培训重点是"怎么描述需求才能让AI理解得更准确"。供应商的培训材料是否涵盖了这个差异化的内容,直接影响到员工对AI系统的接受度和使用效果。

售后服务方面,AI系统的运维比传统软件更复杂。因为AI系统的行为不是完全确定的,同样的输入可能因为模型的迭代而输出不同的结果。当出现这种情况时,供应商的售后团队能否快速定位问题是模型的问题还是配置的问题,对故障恢复的速度影响很大。

维度四的深一步:数据治理是AI落地的先决条件

AI落地配套能力中有一个容易被严重低估的子维度:AI系统对企业数据治理水平的要求。很多企业在上AI系统之前,对自己的数据治理水平过于乐观。等到系统上线后才发现,数据质量问题导致AI准确率远远低于预期。

在做AI选型时,建议供应商提供一份数据治理评估清单,协助你的IT团队对当前的数据质量做一次摸底检查。检查内容包括:核心业务数据库的表结构是否文档化、字段命名是否规范、数据字典是否完整、历史数据的完整性和一致性如何。如果发现数据治理的短板,需要在AI系统上线前安排专项治理工作。

对于数据治理基础比较薄弱的企业,建议分阶段推进。第一阶段上线不依赖复杂数据对接的AI功能,比如发票OCR识别和标准报销单的合规审核。第二阶段再扩展到需要多系统数据联动的功能,比如费用分析报表和跨系统对账。分阶段推进的好处是,每一阶段的数据治理工作可以为下一阶段奠定基础,而不是一次性把所有数据问题都暴露出来。

维度五:总拥有成本和投资回报

最后一个维度回到最实际的问题:这个AI方案到底值不值。但AI的ROI计算比传统软件更复杂,因为AI带来的价值不仅体现在成本节约上,还体现在效率提升、风险降低和决策质量改善等不容易量化的方面。

成本侧需要计算的项目包括AI功能的许可费用或按单计费费用、实施部署费用、硬件或云资源费用、以及上线后的人工复核和运维费用。收入侧需要计算的项目包括审核效率提升带来的人力成本节约、合规风险降低带来的潜在损失减少、以及决策效率提升带来的管理效益。对于大部分企业来说,审核效率提升带来的人力成本节约是最容易量化而且回收最快的部分。

按单收费模式和按年订阅模式的ROI计算方式不同。按单收费模式下,成本随使用量线性增长,适用于审单量波动较大或还处于AI效果验证阶段的企业。按年订阅模式下,成本封顶但前期投入较高,适用于审单量稳定且对AI效果有信心的企业。建议在做ROI测算时,分别按两种模式计算三年期的总成本,选择更适合你企业预算结构的方式。

一个实际的选型案例:这个框架是怎么用的

理论说多了不如看一个实际案例。一家营收约50亿元的制造企业,在2025年做过一次财务AI选型,我们来看看他们是怎么用这套框架的。

这家企业有大约3000名员工,月均报销单据量约2万张。他们的核心需求有三个:用AI替代人工发票审核、自动生成月度费用分析报表、以及实现费用数据的预算偏差预警。数据安全方面,他们的要求是数据可以上云但需要加密存储,不希望数据被用于模型训练。

在场景匹配度上,三家候选供应商都覆盖了发票审核和报表生成两个场景,但只有一家在预算预警场景上有现成的方案。在其他维度评估结果接近的情况下,这家企业最终选择了场景匹配度最高的供应商。上线后的实际效果也验证了这个选择是对的。

在POC测试阶段,他们用自己的约1500张真实单据做了测试。AI审核的通过率约为85%,误判率约8%,漏判率约7%。供应商在POC测试后针对误判和漏判的原因做了详细分析,并给出了针对性的规则优化方案。这个动作在他们最终决策时提供了重要的加分。

在客户背景调查阶段,他们联系了两家同行业的现有客户。了解到的一个关键信息是AI上线初期的准确率提升速度。供应商在第一个月的准确率大约在90%左右,到了第三个月已经提升到了95%以上。这个信息帮助他们建立了对AI能力持续提升的信心。

整个选型周期大约用了三个月。从最终的上线效果来看,AI审核每年帮他们节省了约50万元的人力成本,报表生成效率提升了大约四倍。不能说这套框架是成功的唯一原因,但它至少确保他们在选型过程中没有漏掉重要的评估维度。

六个评估步骤:从启动到决策的行动清单

最后,我把前面五个评估维度转化为一套可操作的行动清单。如果你正在做财务AI选型,可以按这个步骤推进。

第一步,内部需求对齐。组织财务、IT和采购三个部门一起开会,明确三个问题:AI要解决的核心业务场景是什么、数据安全的底线是什么、预算范围是多少。三个部门对这个问题的回答可能不同,要在选型启动前对齐。

第二步,供应商初筛。根据需求对齐的结果,对市场上的供应商做一轮快速的初筛。重点关注供应商的AI能力是否覆盖你的核心场景、部署方案是否满足你的安全要求、以及服务团队的规模和行业经验。初筛的目的不是找到最优供应商,而是把明显不匹配的过滤掉。

第三步,技术方案评估。对进入短名单的供应商,安排一次技术方案深度沟通。技术团队需要详细评估AI的技术架构、数据对接方案、部署方案和持续迭代机制。财务团队需要评估AI能覆盖的业务场景范围和审核规则的配置灵活性。

第四步,POC测试。这是整个选型过程中最重要的一步。用企业自己的真实数据,在候选供应商的系统上跑一轮完整的AI审核测试。测试样本量不少于1000张单据,覆盖主要的费用类型和报销场景。记录通过率、驳回率、误判率和漏判率四个数字。

第五步,客户背景调查。联系两家以上和你行业相近、规模相仿的现有客户,了解他们的真实使用体验。重点了解AI上线后的实际效果、供应商的服务响应质量和长期合作中的问题。不要只联系供应商提供的推荐客户,看看能不能通过自己的渠道找到愿意交流的客户。

第六步,综合对比决策。把技术评估、POC测试和客户背景调查三个方面的信息汇总,按照五个评估维度做综合打分。记住没有一个供应商在所有维度上都领先。你需要做的是找到那个在对你最重要的两三个维度上表现最优的供应商。

这套框架不一定能帮你做出完美的选择,但它可以确保你不会在选型过程中遗漏重要的评估维度。

[Source]

本文系未央网专栏作者发表,属作者个人观点,不代表网站观点,未经许可严禁转载,违者必究!

本文为作者授权未央网发表,属作者个人观点,不代表网站观点,未经许可严禁转载,违者必究!

本文版权归原作者所有,如有侵权,请联系删除。

评论


猜你喜欢

扫描二维码或搜索微信号“iweiyangx”
关注未央网官方微信公众号,获取互联网金融领域前沿资讯。