企业AI项目可行性评估框架:数据、算力与组织能力
- 为什么很多AI试点走不远
- 场景筛选:先找可度量的痛点
- 数据就绪度评估
- 技术路径:API、微调还是自研
- 成本与TCO粗算
- 组织与流程条件
- 立项决策清单
企业引入生成式AI时,最常见的失败模式不是「模型不够强」,而是「场景选错、数据不可用、成功标准模糊、上线后无人运维」。演示阶段人人满意,一到真实流量就出现幻觉、权限泄漏、响应超时或成本失控。
本文提供一套可在立项会使用的评估框架。它不替你选择具体供应商,而是帮助你回答四个问题:值不值得做、能不能做、先做什么、做到什么算成功。
一、为什么很多AI试点走不远
我们观察到试点夭折通常同时具备下列特征中的至少三项:
- 目标写成「提升效率」「赋能业务」,没有基线指标与对照实验。
- 知识文档散落在个人网盘,权限混乱,无法合法用于检索。
- 把Chat界面当成产品完成态,缺少工作流嵌入与人工复核。
- 只有算法同学推进,业务、法务、安全、运维缺席。
- 用公开Benchmark替代业务评测,上线后用户投诉与评测分数脱节。
因此,可行性评估必须从业务与数据开始,而不是从模型参数表开始。
二、场景筛选:先找可度量的痛点
优先选择同时满足以下条件的场景:
- 高频:每天/每周有稳定发生量,值得自动化。
- 文本密集:输入输出以语言、文档、表格描述为主。
- 容错可控:错误可被规则、二次确认或人工拦截。
- 价值清晰:能换算成时长节省、转化提升或客服成本下降。
相对更适合早期落地的例子:工单预分类、邮件草稿、会议纪要结构化、内部知识问答(带引用)、代码辅助审查、营销文案多版本生成后人工精选。
相对更高风险、需后置的例子:自动对外承诺报价、无人值守医疗建议、直接变更生产配置、涉及敏感人事结论的自动决策。
| 场景类型 | 推荐策略 | 关键控制 |
|---|---|---|
| 内部效率工具 | API+轻量RAG快速试点 | 权限隔离、审计日志 |
| 对客内容生成 | 人机协同发布 | 审核队列、品牌语料 |
| 高风险决策 | 暂缓或仅辅助展示 | 强制人工确认 |
三、数据就绪度评估
生成式AI项目的数据问题往往比算法更重。评估时可打分(每项0–2分):
- 是否存在权威、可更新的知识源(而不是过期PPT)。
- 是否具备文档清洗与切分能力(去页眉页脚、表格保留)。
- 是否有清晰的数据分级与访问控制(公开/内部/机密)。
- 是否允许将数据发送至第三方模型服务(合同与合规)。
- 是否能构造评测问答对或标注样本。
总分低于4分时,不建议直接采购大模型坐席或复杂Agent;应先做数据治理与最小知识库建设。很多团队花两个月调Prompt,却不肯花两周整理FAQ与制度文档,最终效果必然不稳。
经验法则:如果业务专家无法在30分钟内指出「正确答案应引用哪份文件」,RAG项目大概率会失败。
四、技术路径:API、微调还是自研
三条路径并非高低之分,而是约束不同:
调用商业/开源API:适合验证与中小流量。优点是快;代价是数据出境/入云风险、厂商依赖与单价波动。务必确认日志留存策略与区域部署选项。
微调开源模型:适合术语密集、风格强约束、需要离线部署的场景。需要GPU、训练数据与持续评测。若只是「希望它更懂我们公司」,多数情况RAG更划算。
自研预训练:极少企业具备数据、资金与人才条件。除非你的护城河就是模型能力本身,否则不要以此作为第一阶段目标。
五、成本与TCO粗算
首年总拥有成本(TCO)建议至少包含:
- 模型调用费或GPU租赁/折旧
- 向量数据库与对象存储
- 应用开发与集成(权限、SSO、工单系统)
- 评测与红队测试人力
- 内容安全审核与人工兜底班次
- 监控、日志与安全合规审计
粗算示例:假设每天5000次问答,平均输入1200 Token、输出400 Token,单价按「每百万Token若干元」估算后,再乘以1.3–1.8作为重试与多轮膨胀系数。把结果与人工客服人均成本对比,才能判断ROI是否成立。
同时设定熔断:日预算上限、单用户配额、高峰降级为检索结果列表(不生成长文)。没有熔断的AI功能,很容易在一次活动流量中把季度预算打穿。
六、组织与流程条件
技术可行不等于组织可行。立项前确认:
- 是否有明确业务Owner,而不只是「创新小组」兴趣项目。
- 是否有周度评测例会,能根据失败案例更新知识库与提示。
- 安全与法务是否已给出数据出境/生成内容责任边界书面意见。
- 客服或业务一线是否参与验收,而不是只看技术Demo。
- 上线后谁负责事故响应(错误承诺、敏感泄漏、批量幻觉)。
七、立项决策清单
建议在立项材料中逐项勾选:
- 成功指标与基线数据已写明(例如:首次响应时长、人工接管率、满意度)。
- 数据来源、更新频率、权限模型已确认。
- 技术路径(API/RAG/微调)与退出策略已确认。
- 首年TCO与预算熔断已确认。
- 风险清单(幻觉、隐私、滥用)与缓解措施已确认。
- 90天试点范围与Go/No-Go标准已确认。
若以上六项无法在两周内补齐,说明项目仍处在概念阶段,应缩小范围再启动,而不是扩大采购。AI落地的竞争力,往往来自场景纪律与数据质量,而不是更早买到更大的模型。
延伸阅读:RAG详解、生成式AI风险与治理、LLMOps持续交付。