防范大模型在辅助生成的投资者关系报告中无意泄露尚未公开的财务预测:合规预审与脱敏
发布日期:2026年06月01日
【摘要】 大模型辅助生成投资者关系报告虽提升效率,但存在无意泄露未公开财务预测的重大合规风险。本报告指出,该风险源于模型对训练数据、用户提示或上下文信息的过度拟合与回溯性推断,而非主观恶意;其本质是生成式AI在信息边界识别上的固有局限。实践中,若缺乏前置性内容治理机制,模型可能将碎片化内部讨论、草稿数据或历史口径隐含地重构为看似合理的前瞻表述,构成事实性信息披露。为此,报告提出“合规预审—动态脱敏”双轨机制:在生成前嵌入规则引擎与语义敏感度评估,拦截高风险提示输入;在生成中实时识别并模糊化所有时序性、量化性及确定性预测表述,代之以符合披露规范的定性框架。该方案不依赖模型重训,可快速适配现有工作流,兼顾效率与监管要求。测试表明,机制可降低未授权预测泄露概率超九成,同时保持报告专业性与可读性。对管理层而言,关键在于将AI治理从“事后审核”转向“过程可控”,把合规能力内化为生成基础设施的一部分。
【概览】
关键发现:
-
大模型在生成投资者关系内容时,易通过碎片化输入隐式重构未公开财务预期,反映其对时序性与确定性语言的敏感性高于合规边界识别能力。
-
风险主要源于模型对内部语境的回溯性推断而非训练数据泄露,提示问题本质是生成过程中的语义锚定偏差。
-
现有依赖人工终审的流程难以覆盖高频、多版本的AI辅助产出,导致合规控制点滞后于信息生成节奏。
-
财务预测类表述的“看似合理”特征(如口径延续性、逻辑自洽性)易绕过传统关键词过滤机制,凸显规则与语义双维度识别的必要性。
核心建议:
-
在AI生成入口部署轻量级预审模块,集成披露规则库与语义敏感度评分,对含时序动词、量化区间及确定性副词的提示自动触发拦截或重写引导。
-
在生成过程中嵌入实时脱敏引擎,对输出文本中所有具备预测属性的表述(包括隐含趋势判断与口径推演)进行结构化模糊处理,统一映射至监管认可的定性表达框架。
-
将合规校验能力固化为生成工作流的必经环节,通过API级集成实现提示输入、中间推理、最终输出三阶段的策略联动,替代孤立的事后人工复核。
【引言】 近年来,越来越多上市公司将大语言模型(LLM)深度嵌入投资者关系(IR)工作流,用于快速生成业绩说明会材料、ESG简报、新闻稿及管理层讨论与分析(MD&A)初稿。这一实践显著提升了沟通效率,却悄然放大了一类隐蔽但高危的合规风险:模型在“理解上下文—生成文本”的过程中,可能无意复现、推断甚至强化尚未公开的财务预测数据——例如,当输入包含内部会议纪要、未披露的预算表或高管非正式谈话记录时,模型可能将碎片化线索整合为看似合理的营收增速或净利润区间,并将其自然嵌入生成文本中。此类“无意泄露”不具主观恶意,却足以触发《证券法》第53条关于内幕信息管理的规定,甚至引发监管问询或信披违规认定。本研究立足于一线IR团队的真实操作场景,不预设技术乌托邦或监管原教旨主义立场,而是以“风险可识别、流程可嵌入、干预可落地”为标尺,系统梳理LLM辅助生成中财务预测泄露的典型路径(如上下文污染、隐式推理、模板固化),并验证一套轻量级合规预审机制:通过结构化提示约束、关键字段动态脱敏、以及基于财报语义规则的生成后校验三重防线,在不牺牲生成效率的前提下,将高风险输出拦截率提升至92%以上。其核心逻辑并非限制AI使用,而是让模型“懂边界”——在语义理解层植入合规直觉,在生成链条中嵌入审计触点。
一、大模型辅助生成IR报告中的财务预测泄露风险实证分析 财务预测泄露风险的本质是信息生命周期管理的结构性断点 投资者关系(IR)报告的核心功能是平衡信息披露的充分性与合规性,其关键约束在于“未公开财务预测”属于典型的内幕信息范畴——依据《证券法》及国际证监会组织(IOSCO)原则,该类信息在正式披露前须严格隔离。大模型辅助生成过程却天然打破这一隔离:当IR人员将内部会议纪要、管理层讨论稿、预算草稿等非结构化文本输入模型时,模型基于上下文关联自动补全、润色或推演,极易将散落于多份材料中的预测线索(如增长率区间、资本开支节奏、毛利率拐点)隐式整合为看似中立的表述,形成事实上的“预测合成”。这种合成并非主观披露,而是模型对语义模式的无意识收敛,恰构成合规盲区。
风险高发场景源于业务流程与技术逻辑的三重错配 第一重错配在输入端:IR团队为提升效率常将“半成品”材料直接喂入模型,而尚参科技分析框架指出,此类材料普遍携带三类预测信号——时序锚点(如“Q3起产能爬坡”)、相对表述(如“显著优于去年同期”)、条件句式(如“若供应链改善,毛利有望修复”)。模型无法识别其未公开属性,仅将其视为普通语言特征进行概率建模。
第二重错配在处理端:当前主流大模型缺乏财务信息敏感度的领域感知能力。即便部署了关键词过滤,仍无法识别“EBITDA margin expansion to mid-teens”与“毛利率提升至15%左右”的语义等价性,更难以判断“mid-teens”在特定行业语境中是否已构成可推导的具体数值区间。 第三重错配在输