AGENT · LLM RESEARCH · AI PRODUCT · DELIVERY

钟尚坤

  • 珠海复旦创新研究院Agent 大模型科研助理
  • 广州兴灏科技有限公司AI 产品经理 · 慧守超项目负责人

医药背景出发,做 Agent、多模态与 RAG 系统的产品设计与工程落地。习惯把模糊问题拆成可验证的链路:先跑通最短闭环,再用固定样本、回归测试和可视化报告,让结果经得起复查。

钟尚坤
Zhong Shangkun 广州 · 珠海 · 远程协作
NOW

在珠海复旦创新研究院围绕 Agent 与大模型应用做科研支持:Agent 工作流、评测流水线与科研自动化工具;同时在兴灏科技负责零售视觉核验与健康档案 Agent 两条产品线的交付。

Agent 工作流多模态文档理解边缘视觉科研自动化可验证交付
26自研项目(去重后)
1 + 1发明专利申请 · 实用新型申请
2软件著作权登记
省二等奖“互联网+”大赛 · AI 中医赛道
10+日常协作的 Agent 编程平台
01

从论文到实验

把方法调研、实验设计、评测口径与流水线搭建做成可复现、可交接的科研工具。

02

从模型到系统

组合 LLM、VLM、OCR、RAG 与 Agent 能力,重视证据链、失败边界与成本。

03

从 Demo 到验收

用真实输入、离线回归和可视化报告证明结果,而不是只展示界面。

SELECTED SYSTEMS

代表项目

只写方向、做法与我的角色;客户、数据、参数、架构细节与源码均不公开。

01零售视觉 · 边缘 AI

慧守超 · 自助收银 AI 漏扫核验系统

面向零售自助收银的漏扫与走单问题。用“屏幕账单 OCR + 台面商品视觉”双证据交叉核验、交易状态机与异常留证,替代单一视觉模型的直接判定;边缘端 ARM 开发板无人值守运行,云端 VLM 只在语义不确定时介入,配套人工复核台、设备集群监控与双机位测试台。

  • 角色项目负责人,0 → 1 统筹规划、方案、实现与试点
  • 状态真实门店原型部署与预测试;发明专利申请、软著 2 项、深创赛入选
YOLOOCRVLM边缘部署Flask树莓派 / RK3588
02大健康 · 多模态 RAG

企业级多模态健康档案 Agent

把体检与检测报告(PDF、扫描件、照片)变成可检索、可回溯的结构化事实:VLM 版面识别 → 分块转录 → 带坐标事实 → 分诊与人工核对 → 健康档案 → 带原文引用的问答。精确问题走确定性查询,解释类问题走 RAG;不确定的内容 Fail-closed,宁可送审也不错误入档。

  • 角色产品负责人,全链路方案、评测机制与验收
  • 状态完成 B 端交付;离线回归与客观打分器保障每次改动可复查
VLMOCRRAGNode.jsError Taxonomy回归测试
03科研自动化 · 循证医学

Meta 分析论文撰写全流程

从一批 PDF 到符合目标期刊要求的投稿稿:双通道数据抽取核对、纳入分诊、Meta 分析与影响诊断、R 出图、中英文写作、文献池构建与引用核实、期刊推荐与投稿改稿。九个阶段,每个阶段都有人工签字关卡。配套 LivingEBM 选题批量评估、文献批量获取与 SPSS 语法生成器。

  • 角色独立设计与实现
  • 状态真实投入使用,已沉淀为可复用的 Agent 技能
PythonRLLMPubMed
04科研 Agent · 函数调用

横向课题机会监控 Agent

为科研团队每日自动巡检多地官方渠道的课题与基金机会:LLM 通过函数调用操控搜索、官方网页读取、去重与证据保存工具,区分“新发布 / 新检出 / 状态变化”,只采信官方原文并留存哈希证据;选定机会后生成申报书骨架与 Word 简报。

  • 角色独立设计与实现
  • 状态本地可运行版本,定时任务每日执行
DeepSeekFunction CallingSearXNGNode.js
05量化研究 · 多 Agent 情报

ETF 期货量化控制台 · 市场情报中心

本地量化研究、回放与仿真控制台:策略、风控、账本、网关、回放与报告分层;TEST / REPLAY / LIVE_LOCKED 三态,真实下单默认锁死。配套多 Agent 市场情报服务:证据链、事件流、品种影响与成本复盘,LLM 只做证据与否决,不决定数量与价格。另有 A 股模拟盘、自主选股智能体等系列实验。

  • 角色独立设计与实现
  • 边界仅研究与模拟验证,不构成投资建议,不宣称收益
FastAPIReact + TSSQLitepytestPlaywright
06语音 Agent · 实时交互

AI 需求共创 · 实时语音 Agent

以“打电话”的方式做企业 AI 需求访谈:流式 ASR、访谈式对话大脑、语音断句启发式、TTS 与视觉理解串成低延迟通话链路;大脑支持云端模型与本地 vLLM 自动切换,本地不通自动回退。配套产品原型与融资路演材料。

  • 角色独立设计与实现
  • 状态本地可运行 Demo,含端到端模拟与 UI 冒烟测试
WebSocketASRTTSvLLMNode.js

COMPLETE PORTFOLIO

全部项目

去重后 26 个自研项目,按六个方向分组。同一产品线下的子系统、测试台、运维工具与材料归入所属项目的“组成部分”,不单列;第三方开源项目与学习性克隆不计入。只写方向、组成与状态,不披露商业实现细节。

26 PROJECTS
01零售视觉

慧守超 · 自助收银 AI 漏扫核验系统

屏幕账单 OCR 与台面商品视觉双证据核验,边缘端无人值守运行

  • 边缘端实时识别与录制程序
  • 人工复核台与异常留证
  • 门店设备数据终端
  • 双机位 VLM 素材测试台
  • 收银台监测支架参数化 CAD
  • 商超场景三维重建实验
  • 品牌与商业材料
  • 知识产权与申报材料

项目负责人,0 → 1 统筹规划、方案、实现与试点真实门店原型部署与预测试

02数据采集

超市价签采集系统

手机连拍直传、云端识别、条码解码、一键导出 Excel

  • 手机端网页采集
  • 对象存储直传与签名外链
  • 云端文档识别批处理流水线
  • 条码条纹解码与价签字段抽取
  • 账号体系与固定列 Excel 导出

独立设计与实现已部署服务器,持续迭代

03健康 AI

企业级多模态健康档案 Agent

报告 → 带坐标事实 → 人工核对 → 健康档案 → 带引用问答

  • 页面级证据提取管线
  • 分诊与人工核对界面
  • 健康档案草稿与批准入档
  • 证据索引与带引用的 RAG 问答
  • 证据可视化与 HTML 验收报告
  • 离线回归、端到端测试与客观打分器
  • 向量检索引擎隔离 PoC

产品负责人,全链路方案、评测机制与验收完成 B 端交付

04中医 AI

中医 AI 助理与内容 Agent

诊疗录制、语音转写、案例结构化、知识库问答与多平台内容生成

  • 诊疗录制与 ASR 转写
  • 案例结构化与方剂 / 中药知识库
  • 多平台科普文案与海报生成
  • 公众号自动回复
  • 路演材料与商业计划书生成脚本

产品负责人,产品架构、Agent 方案与路演可运行原型;“互联网+”大赛省级二等奖项目

05科研可视化

TCM-ES 可解释 AI 可视化与复现

把前沿论文的嵌入空间逻辑做成浏览器可交互演示,并用 PyTorch 复现核心机制

  • 零后端单页交互可视化
  • PyTorch 对比学习机制小规模复现
  • 结果图与指标报告

独立设计与实现已开源,可在线访问;标注为教育性重构,不用于诊疗

06循证医学

Meta 分析论文撰写全流程

从一批 PDF 到符合目标期刊要求的投稿稿,九阶段流水线

  • 双通道 PDF 数据抽取与核对
  • 纳入分诊与预设结果审阅
  • Meta 分析、影响诊断与 R 出图
  • 中英文摘要、方法与结果写作
  • PubMed 文献池、引言讨论与引用核实
  • 期刊推荐与投稿改稿检查表
  • 沉淀为可复用的 Agent 技能

独立设计与实现真实投入使用

07科研工具

LEM 学术自动化套件(选题与筛选段)

选题评估、文献获取、论文初稿与统计作业的桌面级自动化

  • LivingEBM 选题批量评估
  • 文献批量获取与 RIS 调度工作流
  • 论文自动生成系统
  • SPSS 语法生成器

独立设计与实现真实投入使用,子系统成熟度不一

08开源工具

PaperAuditKit

论文统计与图像异常信号筛查,仅供人工复核

  • 表格审计流水线
  • PDF 表格与图像抽取、感知哈希相似度
  • CLI 报告与本地复核 Web UI
  • 伦理边界说明

独立设计与实现已开源(MVP)

09科研 Agent

横向课题机会监控 Agent

函数调用巡检官方来源,留证去重,生成申报骨架与简报

  • 多工具函数调用 Agent
  • 证据闸门与哈希留证
  • 每日定时任务与手动触发
  • 申报书骨架生成
  • Word 简报自动生成

独立设计与实现本地可运行,定时任务每日执行

10科研服务

教职岗位检索与申请助手

院校库构建、岗位采集、可视化报告与申请信生成

  • QS 院校库与可去性分级
  • 岗位板采集与每日扫描
  • 雷达图 / PDF / DOCX 导出
  • 申请信与联络材料生成
  • 本地 Web 控制台

独立设计与实现持续使用

11系统研究

VLM 推理加速器仿真研究

专用芯片架构建模、性能仿真与研究报告

  • 公开资料与专利图解读
  • 8B 级 VLM 推理仿真模型
  • HTML 研究报告与可视化

独立研究报告已完成

12文档工程

临床研究文档版式保真转换

PDF ↔ Word 字体度量、间距测量与逐页对比

  • 字体与嵌入度量分析
  • 段落 / 表格结构还原
  • 逐页渲染对比与差异报告
  • 临床研究报告模板对齐

独立设计与实现实验进行中

13量化研究

ETF 期货量化控制台 · 市场情报中心

策略 / 风控 / 账本 / 回放分层,真实下单默认锁死;多 Agent 情报证据链

  • 策略、风控、账本、网关、回放与报告分层
  • TEST / REPLAY / LIVE_LOCKED 三态
  • AI 市场情报中心
  • pytest / ruff / Playwright 端到端测试
  • 桌面打包与计划任务

独立设计与实现研究与仿真验证;不构成投资建议,不宣称收益

14自主智能体

龙虾金融 · 自主选股智能体

多源采集、多路推理、分级推荐、模拟交易复盘

  • 多源行情、资金与新闻采集管道
  • 多路独立推理与综合裁判评分
  • T+1 模拟交易与收盘复盘
  • HTML 报告与企业微信推送
  • 定时调度与服务器常驻

独立设计与实现已部署原型;不宣称有效性与收益

15模拟盘

A 股 15 分钟模拟盘

低价股筛选策略、模拟账户与日报,桌面 GUI

  • 行情读取与示例数据
  • 筛选策略与模拟账户
  • 候选池与日报生成
  • EXE 打包

独立设计与实现可运行原型

16AI 短剧

AI 短剧生产流水线

剧本 → 角色与场景 Bible → 分镜关键帧 → 视频生成 → 拼接

  • 剧本与分镜结构化解析
  • 角色 / 场景 Bible 生成
  • 关键帧与视频片段生成、拼接
  • 本地化改编流水线
  • 视觉 / 声音一致性审计与基准

独立设计与实现试制集已产出

17AIGC

AI 音乐 Demo

音乐生成演示与本地验收报告

  • 生成服务与本地页面
  • 验收脚本与 HTML 报告

独立设计与实现可运行 Demo

18图像工具

图像参考工作台

散图合成参考板并调用图像模型,可打包 EXE

  • Image2 Batch Studio
  • Reference Image Studio
  • EXE 打包与本地运行

独立设计与实现可运行

19文档工程

代码驱动 PPT 工具链

逐帧动画、配图生成、渲染 QA 与批量出稿

  • Node / PowerShell / Python 构建脚本
  • AI 配图与逐帧动效
  • 渲染检查与蒙太奇 QA
  • 课堂汇报、商业计划书、融资路演等多套成品

独立设计与实现持续使用

20品牌设计

品牌与商业视觉程序化生成

Logo、名片、宣传册与推广物料的脚本化多轮出稿

  • 医生个人品牌
  • 投资公司名片与宣传册
  • 教育产品界面素材与推广图
  • 多轮方案与印刷定稿

独立设计与实现已交付多套

21语音 Agent

AI 需求共创 · 实时语音 Agent

流式 ASR、访谈式大脑、TTS 低延迟通话

  • WebSocket 通话会话
  • 流式 ASR 与语音断句启发式
  • 访谈式对话大脑
  • TTS 与视觉理解
  • 端到端模拟与 UI 冒烟测试
  • 产品原型与融资路演材料

独立设计与实现本地可运行 Demo

22浏览器 Agent

DSH Chrome 插件

让 Agent 操控真实 Chrome:导航、点击、输入、快照

  • Playwright 驱动的真实浏览器控制
  • DeepSeek Harness 插件接入
  • 会话与设置探针脚本

独立设计与实现可运行

23Agent 技能

Agent 工作流基础设施

自定义 Skills、本地推理服务与平台互通脚本

  • Agent Skills
  • 本地推理与模型服务实验
  • AI 编程平台互通脚本与扩展打包
  • 个人网站与内容生成 / 部署脚本

独立设计与实现持续迭代

24企业接入

企业微信 × 智能体接入服务

消息回调、加解密与异步回复

  • 企业微信回调与加解密
  • 智能体 API 轮询与异步回复

独立设计与实现可运行

25企业知识库

企业知识库 ChatBot

文档投喂、向量化、本地部署与客户移交

  • 知识分类与库结构设计
  • 清洗、分块、Embedding、向量入库
  • RAG 问答与回答验证
  • 本地化部署、培训与移交

需求与方案、实施与移交(实习期间)已交付 3 家企业

26内容 Agent

公众号内容 Agent

采集、撰写、版式套用与定时发布

  • 行业信息采集
  • AI 撰写与选题规则
  • 10+ 套版式套用
  • 定时发布与人工抽检

流程设计与落地(实习期间)稳定运行,实习期累计 120+ 篇

EXPERIENCE

经历

珠海复旦创新研究院 · Agent 大模型科研助理

围绕 Agent 与大模型应用方向为课题组提供科研与工程支持,把研究想法快速变成可运行、可评测、可复现的系统,并沉淀为团队可复用的工具与技能。

  • Agent 工作流研究与实现:设计基于函数调用的多工具 Agent(检索、网页读取、证据保存、去重、报告生成),研究任务规划、工具预算、失败回退与证据闸门等机制,让 Agent 的每一步输出可追溯、可审计。
  • 评测与实验流水线:为大模型与多模态模型搭建固定样本集、客观打分器、离线回归与端到端测试,比较不同模型在结构化抽取、文档理解与问答任务上的准确率、延迟与成本,坚持“一次只改一个变量”。
  • 科研自动化工具:面向循证医学与文献工作构建选题评估、文献获取、Meta 分析与论文写作流水线,以及课题机会监控、申报材料与简报生成等日常科研辅助 Agent。
  • 文献与技术调研:跟踪 Agent、RAG、多模态理解与 VLM 推理加速等方向的论文与开源实现,做小规模机制复现与仿真实验,输出可复用的技术简报与可视化报告。
  • 工程与交付:以 Python / Node.js 实现服务端、脚本与可视化报告,负责本地推理服务、模型 API 接入与部署脚本,确保成果可交接、可复现。

广州兴灏科技有限公司 · AI 产品经理 / 慧守超项目负责人

负责零售视觉核验与健康档案 Agent 两条产品线的需求拆解、方案设计、快速实现、模型评测与部署验收;统筹专利、软著与创赛申报。

  • 慧守超 0 → 1:把漏扫问题拆成实物数量、账单数量、交易状态机与分级处置,定义屏幕 OCR 与台面视觉的职责边界;完成双机位安装原型、边缘设备部署、人工复核台与分阶段评估机制(误报率 / 漏报率 / 转人工率),推进到真实门店预测试。
  • 健康档案 Agent:设计“多格式接入 → VLM 调度 OCR 逐块抽取 → 人工核对 → 证据索引 → 带引用问答”闭环,用 Error Taxonomy、固定样本与全量回归处理漏读、错位与越界引用,完成 B 端交付。
  • Agent 矩阵验证:并行推进金融信息监控、实时语音需求共创、内容生产等方向的 Agent MVP,沉淀接口探针、错误样本、离线回归与 HTML 验收报告的交付模板。

深圳市育全科技有限公司 · AI 产品实习生

围绕企业知识资产化与运营提效,参与企业智能知识助手(B 端 ChatBot)从需求访谈、知识库建设、RAG 问答到本地化部署与客户移交的完整过程。

  • 需求与知识结构:负责需求梳理、知识分类、知识库结构与问答流程设计,把“新人培训周期长、老员工重复答疑、内部资料分散难查”拆成可量化的服务效率问题,并定义资料边界与回答范围。
  • RAG 链路搭建:参与企业资料清洗、分块、Embedding、向量入库与 RAG 问答接入,串联“资料接入 → 召回 → 回答验证”流程;以问题样本复测约束回答来源与业务边界,建立 Prompt 模板与 badcase 更新机制。
  • 部署与移交:参与本地化部署、客户侧测试、问题修正、使用培训与移交,沉淀可复用的知识库实施流程,使系统能够由客户侧持续维护。
  • 成果:累计服务 3 家中小企业客户;常见咨询自助解决率约 80%,新客服上手周期从约 14 天缩短到 2 天,客户持续续约并将运维转到客户侧。

深圳协奥科技有限公司 · AI 产品实习生

围绕公众号内容运营提效,设计并落地一条无人值守的全自动内容生产与发布 Agent。

  • 流程搭建:设计“行业新闻 / 竞品动态采集 → AI 撰写 → 版式套用 → 定时发布”全流程,以低代码编排 + 代码扩展实现,定时自动运行。
  • 内容质量:预设 10+ 套排版样式与选题规则,解决全自动发布场景版式单一、内容同质的问题;通过提示词迭代与人工抽检保障输出稳定。
  • 运营效果:稳定保持每 2 天 1 篇,实习期累计发布 120+ 篇;篇均阅读量较人工运营基准提升约 45%。

广东医科大学 · 中药学 本科

医药专业背景,跨领域自学 AI 工程与产品;“互联网+”大学生创新创业大赛省级二等奖。

WORKING METHOD

我的工作方法

01

先把问题定义清楚

确认使用者、真实输入、失败代价和验收口径,不让模型能力替代产品判断。

02

做最短可运行链路

优先打通完整闭环,再逐层提高准确率、性能、可维护性和体验。

03

让结论经得起复查

固定样本、客观指标、离线回归、端到端测试与浏览器可见证据;一次只改一个变量。

04

交付别人真正能用的东西

代码、运行方式、风险边界和验证结果一起交付,减少后续接手成本。

TOOLCHAIN

工具链

日常以多 Agent 编程平台协作开发,但以可执行脚本、版本记录和实际验收结果作为交付依据。

Agent 编程平台

OpenAI CodexCursorClaude CodeGoogle AntigravityGemini CLITraeClineWindsurfDevinDeepSeek HarnessOpenClawWorkBuddy

模型与推理

Qwen / DashScopeDeepSeek豆包 / 火山方舟OpenAIClaudevLLMOllamaModelScopeAutoDL

视觉与文档

YOLOOpenCVPaddleOCREasyOCRMinerUzxingWhisperFFmpegVGGT / MASt3R

生成与创作

ComfyUIgpt-imageSeedanceMiniMaxBlender参数化 CADpython-pptx / docx

工程与部署

PythonFastAPIFlaskNode.jsReactTypeScriptRSQLitePlaywrightPyInstallerCloudflareTailscale阿里云 OSS树莓派 / RK3588

CAPABILITY MATRIX

能力矩阵

产品与科研

需求拆解、方案设计、实验设计、评测口径、文献与方法调研、路演与申报材料。

AI 系统设计

Agent 工作流、Function Calling、RAG 与证据引用、VLM / OCR 文档理解、结构化输出与反幻觉机制。

工程实现

Python、Node.js、FastAPI / Flask、React / TypeScript、原生 Web、边缘设备部署、本地推理服务。

验证与交付

固定样本、离线回归、端到端测试、客观打分、HTML 验收报告、隐私与凭据边界。

LET'S BUILD

把复杂想法做成可靠系统

关注 Agent、多模态系统、科研自动化与可验证交付。欢迎交流科研合作、产品项目与工作机会。

13544160326@163.com 微信:13544160326