中关村资本
智能化系统升级建设方案
面向“募投管退”的机构级 AI 投资智能体系:在现有投资管理与数据体系基础上,逐步叠加可控、可追溯、可持续演进的智能能力。
交流讨论版 · 2026.08|用于双方进一步确认业务范围、技术路线、首期建设重点与实施方式;正式部署规格、BOM 与排期以 POC 和环境确认结果为依据。
汇报导航
首页先看整体框架与甲方价值主线;技术细节、模型训练、评测口径、算力与待确认参数统一收纳在“其他信息”,便于现场按需展开。
项目理解与建设目标
建议先统一“建设什么”,再讨论模型大小、芯片品牌和硬件采购。核心是建设机构投研智能能力,而不是采购一个通用大模型或报告生成工具。
安全可控
敏感数据本地处理、权限隔离、调用可追踪;公网能力按制度边界受控启用。
业务可用
AI 输出进入真实投研、流程和管理环节,不停留在聊天与通用问答。
判断可复核
关键结论区分内部文件、公网来源与模型推断,保留证据链与人工确认点。
能力可沉淀
把历史项目、基金规则、投资逻辑和组织经验转化为持续更新的机构资产。
总体建设架构
建议采用“机构智能底座 + 业务能力层”的方式增量接入现有系统,不以某一个模型为中心,而以机构投资业务、数据资产与可审计流程为中心。
四类核心业务场景
建议首期不追求“全流程一次到位”,而是优先解决高频、刚性、可验证的问题,再逐步扩展至完整募投管退。
与投资情报
目标:先解决“找到重要信息并按优先级呈现”,再逐步形成企业、人物、团队、产业与基金的关系网络。
- 接入新闻、工商、公众号、GitHub、论文及专业投融资数据源。
- 识别融资、团队、产品、技术、舆情等关键事件。
- 结合基金方向、产业关注与历史接触记录做优先级排序。
- 投资经理可补充会议、关系、判断和备注,沉淀为机构知识。
与材料智能化
目标:把不同基金的规则、模板和审批要求配置到 Fund Policy / Workflow Engine,减少重复编写与反复沟通。
- 自动提示流程节点、材料清单和责任部门。
- 复用经过确认的项目事实,生成指定模板的申请、纪要、投决材料初稿。
- 基金要求变化通过配置更新,而不是反复改代码。
智能审核
目标:把风险和信息缺口前置,让风控从多轮返工转向一次性、结构化预审。
- 按基金规则、模板、材料完整性和信息一致性进行预审。
- 形成缺失项、矛盾项、风险问题和修订建议。
- 重要判断回溯到原始文件、规则来源或人工确认记录。
与主动监测
目标:建立持续更新的项目记忆,降低人员变化带来的信息断层,并支持关键节点和风险持续跟踪。
- 跟踪回购、董事会、融资、工商变化、核心人员变动等事件。
- 异常事件触发风险提示和后续行动建议。
- 逐步连接园区、场景、产业链、媒体和融资服务等投后动作。
私有化、安全与部署思路
核心项目和基金数据原则上在机构内部处理。公网增强能力是否启用、如何脱敏、走哪个网络区,应以甲方制度和数据等级为前提。
不调用外部云模型,适用于核心基金资料、未公开项目、敏感尽调以及完全断网场景。
如业务制度允许,可配置脱敏 / 过滤网关,仅将必要的非敏感查询送往公网,结果回到本地融合。
增量接入原系统
优先通过数据库、API 或文件接口接入现有投资管理系统,在其上增加智能检索、Agent、工作流与知识能力。
确定性数据分工
LLM 负责理解、生成和研判;金额、字段、统计与看板口径由数据库、规则和计算引擎负责。
硬件路线保持中立
应用层尽量与单一硬件解耦,最终结合模型、并发、预算、国产化要求和现有机房环境确定生产配置。
POC 与分阶段实施路径
POC 的目的不是“证明 AI 很强”,而是回答:对甲方真实工作是否可用、是否可验收、是否值得规模化建设。
需求与环境确认
盘点现有系统、数据、安全、用户、并发、数据源与接口;冻结 POC 边界与技术假设。
POC 验证
选取 20–50 个代表性历史项目,优先配置 1–2 个核心场景与风控预审,验证业务与技术效果。
一期生产
建设机构知识底座、核心工作流、权限审计与正式私有化部署,形成稳定生产环境。
模块扩展
逐步扩展 Sourcing、投后、动态看板、更多基金规则,以及必要时的模型后训练。
首期 POC 建议重点验证四件事
| 评测维度 | 建议指标 | 验收方式 |
|---|---|---|
| 事实准确性 | 关键事实提取准确率、数值 / 主体 / 日期错误率 | 与原始材料及人工确认结果对照 |
| 证据溯源 | 关键判断是否指向具体文件、规则或公开来源 | 抽查引用链路与来源标签 |
| 业务完整度 | 是否覆盖指定模板、流程节点和投研关注点 | 业务专家评分 |
| 风险发现 | 关键风险与信息缺口的召回能力 | 与历史尽调 / 投决问题对照 |
| 效率与可用性 | 处理时间、人工修改量、采纳率、试用评分 | 前后对比 + 试用记录 |
| 安全与运维 | 数据边界、权限、日志、稳定性、故障恢复 | 技术 / 信息化联合验收 |
AInvestor 能力基础与合作方式
以现有产品作为 POC 起点,而不是从零定制开发;在此基础上完成机构规则、私域知识、部署环境与工作流适配。
多文件项目工作台
支持 BP、会议纪要、访谈、财务、法务等多类资料的解析、关联与统一分析。
多 Agent 投研分析
可按团队、市场、技术、财务、风险、反方质疑等角色并行分析,并保留任务过程。
来源溯源与复核
区分内部文件、联网信息与模型推断,帮助投资经理快速复核关键结论。
本地化部署
已具备端侧开源模型、OCR、RAG 与 Agent 的本地运行经验,可支持断网场景。
端云协同
可在本地识别和处理敏感信息后,再按制度调用受控公网检索或云端增强能力。
持续评测与优化
通过统一 Benchmark 对比 RAG、Agent、模型与后训练版本,避免仅凭主观演示判断。
甲方侧重点
- 明确业务负责人、技术 / 安全负责人和验收角色。
- 提供授权 / 脱敏的 POC 样本、基金规则、模板与现有系统信息。
- 组织投资、风控等业务专家确认评价口径与结果。
AInvestor / 创造进化侧重点
- 完成需求梳理、数据 / 流程建模和 POC 设计。
- 完成 Agent 工作流、RAG / 知识能力、模型与部署适配。
- 实施评测、培训并形成正式私有化与后续建设方案。
其他信息 / 技术附录
以下内容不作为首页主叙事,现场根据甲方技术、信息化或管理团队关注点按需展开。
技术路线:RAG、知识图谱、Agent 与后训练如何分工
原则是先问“什么问题没解决”,再决定是否训练模型。动态事实、历史原文、关系、基金规则与稳定任务行为应进入不同技术层,而不是全部固化进模型参数。
建议分工
- RAG / 知识库:承载最新、私有、可追溯的机构资料。
- 知识图谱:承载企业—人物—项目—基金—事件等长期关系与跨项目关联。
- 规则 / Policy Engine:承载基金流程、模板、审批规则与风控红线,保证可配置、可审计。
- Agent / Workflow:把复杂投研任务拆解为可组合、可记录的流程。
- SFT / LoRA:仅在 Benchmark 证明有必要时,用于稳定的风险识别、尽调提问、机构化输出与审核行为。
历史数据如何从“文件仓库”变成机构投资记忆
不建议将历史文件一次性“喂给模型”。更适合的做法是先完成盘点、清洗、结构化、专家提炼,再形成可检索、可比较、可评测的 Institutional Memory。
| 阶段 | 处理内容 | 产出 |
|---|---|---|
| 盘点 | 按项目、年份、行业、流程、文档类型建立目录与权限地图 | 数据资产清单 |
| 清洗 | 去重、版本识别、OCR、格式统一、字段规范 | 可用文档集 |
| 结构化 | 项目实体、团队、轮次、估值、风险、投决结论等标签 | 项目知识对象 |
| 专家提炼 | 为什么投 / 不投、关键问题、后续变化与复盘 | 机构判断样本 |
| 评测集 | 代表性项目 + 问题 + 答案 + 证据 + 专家评分 | 统一验收基线 |
Benchmark:如何衡量“是否真的更好”
建议用 20–50 个代表性历史项目形成首期固定评测集,覆盖已投 / 未投、不同赛道、材料完整度与争议情况。核心目的不是追求单一模型分数,而是形成可持续复用的机构验收标准。
算力与硬件:从真实负载倒推,而不是从用户数量直接采购
硬件选型应由“任务 → 模型 → 并发 → 数据吞吐 → 安全要求”倒推。用户数量本身不能直接等价为设备数量;长文档、Agent 数量、上下文长度、OCR 与峰值并发都会影响资源需求。
三级部署思路
- 桌面 / 一体机:适合现场演示、单人 / 小组、离线或高敏独立场景。
- 多 GPU 工作站 / 节点:适合部门级使用、中等并发和 POC / 中等规模生产验证。
- 集中式 AI 服务器:适合多部门共享、较高并发、统一权限日志和长期生产环境。
正式 BOM 前必须确认
- 日活、峰值在线、同时发起重任务的人数。
- 单项目文件数、总大小、扫描 PDF / OCR / 录音占比。
- 目标模型规模、上下文长度与可接受完成时间。
- 现有 GPU / NPU、存储、容器、操作系统、网络分区与国产化要求。
- SLA、备份、高可用与故障恢复要求。
AInvestor 与“通用大模型 / 普通知识库项目”的区别
| 常见做法 | AInvestor 建议的机构方案 |
|---|---|
| 部署一个大模型,让大家聊天 | 围绕投研任务拆 Agent 和工作流,让 AI 进入真实业务流程。 |
| 把资料做成知识库 | 进一步转为项目对象、规则、判断样本、评测集与机构投资记忆。 |
| 生成一份看起来完整的报告 | 强调事实 / 判断分离、来源溯源、风险与缺口识别、人审和可复核。 |
| 先买 GPU,再找场景 | 先用场景和真实负载确定模型,再由模型与并发倒推算力。 |
| 每只基金都做定制代码 | 公共能力产品化,基金个性规则尽量配置化、Policy / Skill 化。 |
POC 结束后建议形成的正式产出
- 《甲方 AI 投研业务与数据需求说明》
- 《POC 效果与评测报告》
- 《模型 / RAG / Agent / 后训练路线建议》
- 《正式私有化部署与硬件选型建议(含并发与容量测算)》
- 《二期建设范围、预算与实施计划》
上述成果将把本次交流从“功能讨论”收口到可立项、可验收、可采购的下一阶段输入。
下一步建议现场确认
建议本次沟通不再继续扩大功能清单,而是共同冻结首期边界,并形成《POC 工作说明书》。