ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

MindsDB 销售分析智能体实战:一条 SQL 打通 MongoDB 与 HubSpot,并用 AI Agent 回答业务问题

MindsDB 销售分析智能体实战:一条 SQL 打通 MongoDB 与 HubSpot,并用 AI Agent 回答业务问题 MindsDB 销售分析智能体实战一条 SQL 打通 MongoDB 与 HubSpot并用 AI Agent 回答业务问题【免费下载链接】ai-engineering-hubIn-depth tutorials on LLMs, RAGs and real-world AI agent applications.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-hub导读本指南基于开源仓库ai-engineering-hub中的sales-analytics-agent项目完整演示如何将MongoDB产品评价 reviews 与销售明细 product_sales和HubSpot企业 companies 与联系人 contacts接入MindsDB先通过单库与跨库 SQL 完成销售分析再基于同一份数据创建sales_agent让它用自然语言回答谁是营收最高的客户某客户处于什么生命周期阶段、累计消费多少这类业务问题。读完本文你将掌握 MindsDB 数据源接入、跨数据库 JOIN、CREATE AGENT智能体配置以及 Python SDK 流式查询的完整实战链路。一、项目概览为什么需要数据库 Agent的组合传统的销售分析流程通常分两步走分析师用 SQL 写查询再人工把结果翻译成业务结论而sales-analytics-agent项目展示了一条更直接的路径——把 CRMHubSpot与交易流水MongoDB作为 MindsDB 的虚拟数据库既能用标准 SQL 做精确统计又能让 AI Agent 直接看懂表结构并自动生成查询、汇总答案。核心步骤记录在 QUERY.md 中共五步创建数据库 → 显示数据 → 查询数据 → 创建 Agent → 查询 Agent配套的 main.py 展示了使用 MindsDB Python SDK 流式获取 Agent 回答的实现README.md 则给出环境搭建与运行说明。整个项目是ai-engineering-hub仓库93 个可运行项目中面向数据层 AI 层的中级实战示例适合已经熟悉 SQL、希望让大模型直接驾驭业务数据的开发者。二、环境准备启动 MindsDB2.1 需要的凭证服务用途使用阶段HubSpotaccess token创建hubspot_data数据库读取 companies / contactsCREATE DATABASEOpenAIAPI key供 AI Agent 调用 LLM 生成 SQL 与回答CREATE AGENTMongoDB连接串创建mongodb_data数据库CREATE DATABASE说明项目作者在示例中已经预置了 HubSpot 与 MongoDB 的数据源见 QUERY.md 中的 demo 连接串可以直接沿用若使用自己的数据替换为自有凭证即可。2.2 启动 MindsDB 容器MindsDB 以 Docker 镜像方式运行同时暴露两个端口47334HTTP APIREST也是 Python SDK 默认连接端口47335MySQL 协议端口任何 MySQL 客户端都可以连上来执行 SQL。docker run --name mindsdb_container \ -e MINDSDB_APIShttp,mysql \ -p 47334:47334 -p 47335:47335 \ mindsdb/mindsdb:latestMINDSDB_APIShttp,mysql显式声明只启用 HTTP 与 MySQL 两种 API控制面更干净。容器启动后MindsDB 会自动创建内置的mindsdb数据库后续的 Agent 就注册在这里。2.3 安装 Python SDK可选如果希望用 Python 而非 SQL 查询 Agent需要 Python 3.8 与 SDKpip install mindsdb_sdk三、第一步把 MongoDB 与 HubSpot 创建为 MindsDB 数据源MindsDB 的核心能力之一是将外部数据库注册为虚拟数据库之后即可用统一的 SQL 方言访问。这一步在 QUERY.md 中通过两条CREATE DATABASE语句完成。MongoDBdemo 连接串包含 reviews 与 product_sales 两个集合CREATE DATABASE mongodb_data WITH ENGINE mongodb, PARAMETERS { host: mongodbsrv://demouser:MindsDB_demomindsdb-demo.whljnvh.mongodb.net/demo };HubSpot使用 access token 认证CREATE DATABASE hubspot_data WITH ENGINE hubspot, PARAMETERS { access_token: pat-na1-d7a93c10-07d1-45fd-ac7a-b109d00d9e2b };语法要点WITH ENGINE声明数据源类型MindsDB 支持数十种引擎PARAMETERS传入该引擎所需的连接参数。MongoDB 使用标准mongodbsrv://连接串HubSpot 则通过 Private App 生成的pat-na1-*形式 access token 认证。创建成功后表名即映射为数据库名.表名的三段式引用例如hubspot_data.companies、mongodb_data.reviews。四、第二步验证数据可见性建库后先用LIMIT 10抽查各表确认字段名与数据类型符合预期这是后续写 JOIN 与 Agent 提示词的前提。HubSpot 企业表抽样字段公司名、域名、行业、年营收、员工数SELECT name, domain, industry, annualrevenue, numberofemployees FROM hubspot_data.companies LIMIT 10;MongoDB 评价表抽样字段客户邮箱、SKU、星级、标题、正文SELECT customer_email, product_sku, star_rating, review_title, review_text FROM mongodb_data.reviews LIMIT 10;五、第三步单库与跨库 SQL 查询5.1 单库查询Q. 产品评价的平均星级是多少SELECT AVG(star_rating) AS average_rating FROM mongodb_data.reviews;AVG(...) AS average_rating为聚合结果起别名便于下游程序解析。5.2 跨库查询核心能力Q. 按营收排名的 Top 10 客户是谁SELECT hc.firstname, hc.lastname, ROUND(SUM(ps.sales_amount), 2) AS total_revenue FROM mongodb_data.product_sales AS ps JOIN hubspot_data.contacts AS hc ON ps.customer_email hc.email GROUP BY hc.firstname, hc.lastname ORDER BY total_revenue DESC LIMIT 10;这是整个示例的技术题眼product_sales来自MongoDBcontacts来自HubSpot而 MindsDB 允许在一条 SQL 里跨两个物理数据库做JOIN。连接键是product_sales.customer_email contacts.email——客户的交易邮箱与 CRM 联系人邮箱一致这个关系在第六节创建 Agent 时还会显式告知模型。ROUND(SUM(...), 2)保证金额保留两位小数。六、第四步创建销售分析 AI Agent跨库 JOIN 解决了如何查而CREATE AGENT解决如何让业务人员直接问。CREATE AGENT sales_agent USING model { provider: openai, model_name: gpt-5.4, api_key: your-openai-api-key }, data { tables: [ hubspot_data.contacts, mongodb_data.product_sales ] }, prompt_template hubspot_data.contacts stores CRM contact data including: id, email, firstname, lastname, jobtitle, company, city, website, lifecyclestage, hs_lead_status. mongodb_data.product_sales stores sales order line items including: order_number, order_date, customer_email, city, state, product_sku, sales_quantity, discount_percent, sales_price, sales_amount, sales_tax_percent, tax_amount. To join both sources, use: hubspot_data.contacts.email mongodb_data.product_sales.customer_email. , timeout 60;逐参数拆解model指定 Agent 背后的大模型。provider: openaimodel_name指明模型系列api_key传入凭证。示例使用gpt-5.4实际替换为你可用的模型标识即可。data.tables声明 Agent 可访问的表清单。这里只开放hubspot_data.contacts与mongodb_data.product_sales两张表——最小权限原则不把全部表暴露给模型避免它看到不该用的数据也缩小了 SQL 生成空间、提升准确率。prompt_template这是 Agent 质量的胜负手。模板不是废话描述而是精确给出两张表的字段清单与 JOIN 关系contacts 表id, email, firstname, lastname, jobtitle, company, city, website, lifecyclestage, hs_lead_statusproduct_sales 表order_number, order_date, customer_email, city, state, product_sku, sales_quantity, discount_percent, sales_price, sales_amount, sales_tax_percent, tax_amount并明确连接键contacts.email product_sales.customer_email。把 schema 写进提示词后模型无需猜测字段名生成的 SQL 可直接执行把 join 规则写进提示词后模型才知道如何跨库关联两张表。这是从能跑到跑得准的关键。timeout 60Agent 单次推理的超时上限秒防止长查询挂死。七、第五步用 SQL 查询 AgentAgent 创建后它本身就是一个虚拟表传入question返回answer。单库问题SELECT answer FROM sales_agent WHERE question What is the total revenue in product sales?;跨库问题SELECT answer FROM sales_agent WHERE question What is the lifecycle stage of noah.johnsonclearwaterholdings.co, and how much have they spent in total?;第二个问题同时涉及两库lifecycle stage字段在 HubSpot 的 contacts 表消费金额要汇总 MongoDB 的 product_sales 表——Agent 需要自行完成定位表 → 生成 JOIN SQL → 执行 → 组织自然语言回答的全链路。提示词中预置的字段清单与 join 规则正是保证它在这一步不犯错的基础。八、进阶用 Python SDK 流式查询 Agent对需要把 Agent 集成进业务系统的场景main.py 给出了 Python 侧的标准写法import mindsdb_sdk # connects to the default port (47334) on localhost server mindsdb_sdk.connect(http://127.0.0.1:47334) agent server.agents.get(sales_agent) # stream the completion completion agent.completion_stream( [ { question: Who is the top customer by revenue? Include their full name, job title, and company from our CRM., answer: None, } ] ) # print the completion for chunk in completion: print(chunk, end, flushTrue)逐行解读mindsdb_sdk.connect(http://127.0.0.1:47334)连接本地 MindsDB 的HTTP API即 docker 启动时的 47334 端口server.agents.get(sales_agent)按名称获取第六节创建的 Agent 对象agent.completion_stream([{ question: ..., answer: None }])以对话消息列表形式发起请求answer置为None表示该轮由模型补全。消息数组结构天然支持多轮上下文扩展for chunk in completion流式streaming消费 tokenprint(chunk, end, flushTrue)实现逐字打印、无需等待完整响应显著改善长回答的体验也适合对接 WebSocket/SSE 等实时场景。注意此脚本默认认为sales_agent已通过 SQL 创建成功若尚未创建会因找不到 Agent 而报错。运行顺序应为先 SQL 建 Agent再 Python 查 Agent。九、调用链与工程要点小结从源码与文档可以梳理出完整调用链SQL 客户端 / Python SDK │ ▼ MindsDB (Docker: HTTP 47334 / MySQL 47335) │ ├── mongodb_data (MongoDB: reviews, product_sales) └── hubspot_data (HubSpot: companies, contacts) │ ▼ sales_agent (OpenAI 模型 data.tables prompt_template)工程实践要点凭证与数据分离建库凭证写在CREATE DATABASE PARAMETERS模型凭证写在CREATE AGENT model均不应提交到版本库最小化 Agent 数据面data.tables只开放必要的表减少幻觉与越权访问schema 前置进提示词把字段名、类型语义与 JOIN 键写进prompt_template是 Agent 生成可靠 SQL 的最强杠杆先 SQL 后 Agent先用单库/跨库 SQL 验证数据与关联逻辑第五节的 Top10 客户查询再把同样的逻辑交给 Agent 自然语言化两者可互为校验流式接入生产集成优先用completion_stream避免长回答阻塞。十、相关文件与延伸阅读本文全部实操内容均可在此仓库中直接复现项目 README环境搭建、Docker 启动与运行总览分步 SQL 指南 QUERY.md本文第三至七节所有 SQL 的原始出处Python SDK 示例 main.py流式查询 Agent 的最小实现仓库总览 README.mdai-engineering-hub的整体项目地图其中 RAG SQL Router、Deploy Agentic RAG 等中级项目与本示例在数据与 Agent 结合方向上可相互参照。适用前提与限制本示例依赖 MindsDB 对 MongoDB、HubSpot 引擎的内置支持以及外部 OpenAI 服务model_name与api_key需按实际可用模型替换示例中的 MongoDB demo 连接串与 HubSpot token 为项目作者提供的演示凭证生产环境务必换成自有数据源。【免费下载链接】ai-engineering-hubIn-depth tutorials on LLMs, RAGs and real-world AI agent applications.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-hub创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进