大模型进企业生产环境撞上的第一堵墙不是算力,而是数据形态。企业真正的业务资产绝大部分躺在二维关系表里,围绕它们还有大量聚合、过滤、关联计算;大语言模型以文本参数为主训练,让它从文字反向理解关系表以及关系表背后的计算,这条逆向工程基本走不通。与其把问题归给“幻觉”,不如说模型对确定性计算缺少认知入口。
对应的路径是把数据中台升级为知识中台。数据中台的基本单位是表和字段,解决“数据在哪、能不能用”;知识中台在此之上叠加一层语义控制层,回答“数据是什么意思、业务规则是什么、如何执行动作”,把自然语言问题转成可验证、可执行、可追溯的语义任务。纳管范围除数据本身,还包括每个系统能做什么计算、计算结果能触发什么业务操作、业务文本里存在哪些对应的规定。
本体的构建顺序被明确为从结构化向非结构化衍生,而不是反过来。理由是要保证统一语义的唯一性和确定性,而业务系统里数据的唯一性天然优于散落在文档中的描述性文字;文档内容之后通过限定本体生成技术对齐。非结构化资料纳入本体后有两个用法:作为知识库参与检索,以及为数字化环境里的复杂计算解析提供语料补充。OLAP 与 OLTP 各自维护一套数据模型造成的割裂,靠本体补齐行为语义、动态过程建模和业务规则约束来打通。
场景本体越建越多之后,真正的风险是碎片化——各场景自建本体互不认、不复用。对应解法是优先构建统一的“图语义”层,锚定数据、计算、操作三类服务知识,这与数仓里先建公共层做语义约束是同一逻辑。静态本体之外,动态本体被视为下一阶段的难点:设备连接关系本身在变,本体需要具备持续的知识抽取与学习能力,而非一次性建模。存储侧则走向图、向量、时序融合的多模形态,既能用向量查图,也能把图编码为向量参与图注意力模型的微调。