证据可追溯的多源招投标智能聚合与增量订阅系统
2026 AI 先锋未来人才大赛 · 超聚变「招投标信息聚合工具」命题
标讯雷达将中文自然语言需求转化为可执行的信息任务:识别主题、地区、时间范围与发送频率,从不少于两个真实招投标来源采集数据(其中至少一个为免费登录来源),完成清洗、条件复核、跨站去重、Word 报告生成以及定时增量推送。
本项目不是单纯的爬虫,也不是让大模型自由总结搜索结果。核心原则是:
- 证据优先:每条核心内容绑定原文片段、来源链接与附件;无证据不补写。
- 多源真实采集:以可插拔适配器接入公共来源和免费登录来源。
- 跨站去重:合并转载项目,同时保留多个来源作为证据。
- 定时增量:订阅任务只推送首次出现或关键信息更新的项目。
- 失败可见:单个来源失败时明确记录原因,并继续使用其他来源交付结果。
当前处于报名开题与 MVP 开发阶段。仓库不会用硬编码结果冒充系统能力;所有完成状态以可复现测试和真实运行证据为准。
| 模块 | 状态 |
|---|---|
| 赛题需求基线 | ✅ 已完成 |
| 开题方案 | ✅ 已完成 |
| 系统架构与工作流 | ✅ 已完成 |
| 团队补充材料 | ✅ 已完成 |
| 自然语言意图解析 | ⏳ 待开发 |
| 公共数据源适配器 | ⏳ 待接入 |
| 免费登录来源 | 🧪 已有前期技术验证,待通用化 |
| 清洗与跨站去重 | ⏳ 待开发 |
| Word 报告生成 | ⏳ 待开发 |
| 定时增量订阅 | ⏳ 待开发 |
| Web UI / API / CLI | ⏳ 待开发 |
自然语言输入
→ 主题 / 地区 / 日期 / 频率解析
→ 多个真实来源并发采集
→ 详情、正文与附件提取
→ 条件复核、噪声清洗、字段归一
→ 项目编号 / 标题 / 主体 / 时间 / 相似度多级去重
→ 生成可信 Word 报告
→ 定时任务仅推送新增内容
| 官方要求 | 标讯雷达方案 |
|---|---|
| 自然语言识别主题、地区、时间、频率 | 规则优先、模型补充的结构化意图解析 |
| 信息来源不少于 2 个 | 插件化 SourceAdapter 并发采集 |
| 至少 1 个登录来源 | 接入免费会员可见信息,凭据与代码分离 |
| 去除导航、广告和模板内容 | 详情正文抽取与来源级清洗器 |
| 相同内容去重 | 强标识 + 组合指纹 + 近似文本多级去重 |
| 标题、时间、链接、核心内容、附件 | 统一数据模型与证据约束摘要 |
| 立即执行与定时执行 | 任务服务 + 调度器 |
| 定时任务仅推送新增内容 | SQLite 推送指纹与执行历史 |
| 输出 Word | python-docx 按官方规则命名 |
bidscope/
├── README.md
├── docs/
│ ├── 比赛需求基线.md
│ ├── 开题报告初稿.md
│ └── 实施计划.md
├── submission/
│ ├── 标讯雷达_BidScope_团队补充材料.pdf
│ ├── 标讯雷达_BidScope_团队补充材料.docx
│ └── assets/
│ ├── architecture.png
│ ├── workflow.png
│ └── roadmap.png
└── scripts/
└── build_submission_pack.py
- 核心管道:官方示例意图解析、统一数据模型、清洗、去重、SQLite、Word。
- 真实多源:接入不少于两个真实来源,其中至少一个为免费登录来源。
- 订阅闭环:立即任务、每日/每周调度、已推送指纹与增量报告。
- 演示交付:Web UI、API、CLI、详设文档、操作文档和 Demo 视频。
团队此前已开展国内商业招投标平台的真实工程探索,包括:
- SPA / JavaScript Bundle 分析与真实 API 定位;
- 免费登录态、Cookie 会话和登录失效检测;
- 监控数据获取、关键词和地区二次过滤;
- 本地缓存、简单去重、定时邮件与 FastAPI 展示。
旧实践面向单一平台和固定业务条件,不能直接满足本赛题。因此参赛项目采用全新通用架构;旧成果只作为数据源接入、登录维护和风险处理经验,不把人工构造测试数据冒充正式结果。
- 仅使用公开页面和免费会员可见信息;
- 不绕过付费权限、验证码或访问控制;
- 凭据保存在本地环境变量或受控配置中,不提交到仓库;
- 不上传 Cookie、手机号、密码、邮箱授权码或 API 密钥;
- 核心摘要必须可回溯至原文证据。
标讯雷达 BidScope|让每一条企业情报都有来源、有状态、有后续。


