• 博客(236)
  • 收藏
  • 关注

原创 Bright Data 抓取浏览器 Puppeteer 项目

使用 GitHub 账号登录,然后 fork 该仓库以开始修改。本项目演示如何使用,结合 Node.js 与 Puppeteer,从网站抓取数据。

2026-09-18 08:00:00 129

原创 Bright Data 抓取浏览器 Node.js Selenium 项目

使用 GitHub 账号登录,然后 fork 该仓库以开始修改。本项目演示如何使用,通过 Selenium WebDriver 从网站抓取数据。

2026-09-16 08:00:00 255

原创 Scraper Studio 现已入驻 AI 编程助手,在命令行中即可为任意网站构建爬虫

🔗 如需参考文档:Bright Data CLI 构建爬虫,请移步https://docs.brightdata.com/cn/datasets/scraper-studio/build-with-the-cli。而且整个过程都是自然语言驱动,即使是不懂技术的用户,也能轻松从任意网站获取干净、结构化的数据 —— 无需任何爬虫经验。—— 用自然语言描述目标网站和想要提取的数据,AI 自动生成爬虫。等 AI 编程助手 —— 直接在你熟悉的终端里就能完成。—— 立即获取结构化 JSON 数据。

2026-09-14 09:55:22 137

原创 Bright Data SDK

Bright Data API 的官方 TypeScript/JavaScript SDK。目前支持 Web Unlocker API。

2026-09-11 08:00:00 69

原创 Bright Data Unlocker + AWS S3 Node.js 示例

根据需要在index.js或通过环境变量修改targetUrl或format。如需调整 S3 存储路径或元数据,可在uploadToS3函数中修改。

2026-09-09 08:00:00 257

原创 Bright Data 解锁 Webhook 演示

一个用于接收 Bright Data 解锁事件的简单 Next.js Webhook 监听器,可直接部署在 Vercel 上运行。

2026-09-08 09:32:10 231

原创 Bright Data Web Unlocker Node.js 项目

该脚本通过使用 Bright Data 的 Web Unlocker,帮助你在访问具备反爬虫保护或包含验证码的站点时自动绕过这些障碍。注意:这是一个用于学习的示例实现。在生产环境中,请考虑增加更完善的错误处理、日志记录与安全措施。本项目演示如何使用 Bright Data 的。通过 Bright Data 的。

2026-09-04 08:00:00 445

原创 BrightFlow

演示项目:基于 DeerFlow 构建的原型,用于展示 Bright Data 在研究自动化中的网页智能能力。

2026-09-02 08:00:00 244

原创 网络直播:本体 Ontology 和 RAG 如何让 Agent 更好的理解业务?

本体 Ontology 和 RAG 如何让 Agent 更好地理解业务?

2026-09-01 08:00:00 101

原创 亮数据 Data Firehose 实时数据流现已支持图片与 PDF 全内容抓取!

现在,Firehose 可以实时交付页面上真正存在的内容——不管是文本、图片、PDF,还是任何挂在页面上的文件,全都能拿到手。Firehose 从"给链接"升级为"给内容",实时图片、PDF、文件全都能直接拿到手,让客户真正用上"活的"互联网数据。划重点:这不是历史存档数据(比如 Web Archive 那种"时光机"式的归档),而是此时此刻互联网上正在发生的真实内容。Data Firehose 是我们的实时网页缓存服务——一个每 24 小时新鲜采集约 15 亿 个公开网页的实时数据流。

2026-08-31 16:21:37 250

原创 Browserai MCP,为 AI 代理赋能实时网页数据

欢迎使用 Browserai 模型上下文协议(Model Context Protocol,MCP)服务器。它旨在让大语言模型(LLMs)、AI 代理和应用能够实时访问、发现并提取网页数据。该服务器使 MCP 客户端(如 Claude Desktop、VS Code、Cursor、WindSurf 等)能够无缝搜索全网、导航网站、执行操作并高效获取数据,即使面对带有反爬机制的网站也能应对自如。

2026-08-31 08:00:00 315

原创 n8n-nodes-brightdata

这是一个 n8n 社区节点。它可以帮助你在 n8n 中使用。如果你有任何问题或建议,请。是一个的工作流自动化平台。

2026-08-28 08:00:00 362

原创 Bright Data TrendScan

多源公司情报平台——从 Crunchbase、LinkedIn 与 Reddit 自动采集并以 AI 驱动分析公司数据。

2026-08-26 13:44:14 222

原创 使用 Cypress 绕过 CAPTCHA

CAPTCHA(全称为 Completely Automated Public Turing test to tell Computers and Humans Apart)是一种安全机制,用于区分真实用户与自动化脚本。它会给出对人类较易、对机器较难的挑战,常被放置在网页关键位置以阻止机器行为。

2026-08-19 08:00:00 340

原创 网络直播:Agent时代,如何供给高质量数据?

2026-08-14 08:00:00 50

原创 使用 Python 绕过 CAPTCHA

CAPTCHA(Completely Automated Public Turing test to tell Computers and Humans Apart)是一种用于区分人类用户与机器人的挑战。它要求执行对人类容易、对自动化软件困难的任务。随着 AI 的发展,CAPTCHA 为保持有效性变得越来越复杂。下面是当下最常见的 CAPTCHA 类型。

2026-08-14 07:45:00 266

原创 使用 Selenium 在 Python 中绕过 CAPTCHA

CAPTCHA(Completely Automated Public Turing test to tell Computers and Humans Apart)用于区分人类用户与机器人。它提供人类易做、机器难做的挑战。常见提供商包括 Google reCAPTCHA、hCaptcha 和 BotDetect。

2026-08-12 08:00:00 312

原创 Cloudflare CAPTCHA 解决方案

Bright Data 的 CAPTCHA Solver提供高级自定义选项,可根据特定需求微调解题逻辑。事件监控:检测到 CAPTCHA,开始解题。:成功解决 CAPTCHA。:CAPTCHA 解决失败。价格方案价格 (每 1K 结果)月度费用描述按需付费$1.50无承诺适合临时爬取需求。Growth$1.27$499专为成长型团队打造。Business$1.12$999适合大规模爬取操作。Premium$1.05$1,999提供高级功能及优先支持。Enterprise。

2026-08-10 10:28:24 256

原创 小米新发布的 Robotics-1 在向市场传递什么信息?

排行榜动态、arXiv/GitHub机器人领域的最新发布,以及竞品基础模型的动态(如Physical Intelligence的π0.5、Google RT-X等)——让厂商的研究团队获得持续的竞争情报,而非依靠人工追踪。Bright Data 是数据基础设施层,能将整个公开互联网——YouTube、TikTok、电商目录、教程内容、全球住宅环境——转化为合规、持续刷新的数据管道,正是这类UMI预训练和指令对齐数据才能让像XR-1的具身智能设备达到了业界领先水平。"小米已经用UMI打破过一次数据壁垒。

2026-08-07 15:29:22 254

原创 Crunchbase 爬虫

将下载的脚本文件和相关资源包(如配置文件、依赖文件等)放置到你的项目目录中。IP 封禁与速率限制:Crunchbase 会监控并限制来自同一 IP 的请求。动态站点结构:Crunchbase 经常更新页面布局与代码,任何变化都可能导致脚本失效并需要持续维护。提供稳健、可扩展、低门槛的方式,无需处理抓取复杂性即可从 Crunchbase 提取全面数据。基于同样强大的底层基础设施,你无需写代码即可配置并启动 Crunchbase 采集任务。针对指定的 Crunchbase 公司页面,返回完整的档案信息。

2026-08-07 08:00:00 54

原创 Google 航班爬取器

可在规模化场景下不触发 CAPTCHA 或 IP 封禁的情况下,实时提取价格、时刻表、航司信息等航班数据。一个用于从 Google Flights 进行小规模数据提取的快速、简单的爬虫。通过以下可选参数,精细化你的 Google Flights 数据提取。如需稳定、可扩展的抓取能力,请参考下方的专用 API。或者,使用 Bright Data 的代理路由方式。可降低被 Google 反抓取措施检测的概率。示例:以美元(USD)返回价格。参数指定返回价格的货币。注意:用于生产时,请按照。

2026-08-05 08:00:00 253

原创 谷歌酒店抓取器

学习如何从 Google(全球最大的旅行数据聚合平台之一)抓取实时酒店数据。

2026-08-03 10:51:40 200

原创 谷歌地图爬虫

参数类型描述示例limit整数限制每个输入返回的结果数量limit=10布尔在输出中包含错误报告,便于排障notifyURL采集完成后回调通知的地址format枚举数据交付格式:JSON、NDJSON、JSONL、CSV提示:还可通过Webhook或API 拉取的方式交付数据。

2026-08-03 10:50:08 340

原创 谷歌评论 API

Bright Data 的 API 支持多种高级参数,帮助你精细化提取评论数据。提供结构化评论数据,具备高级特性与可扩展性。获取“解析后的 JSON + 完整嵌套 HTML”。适合需要小规模提取评论的用户,快速上手、开箱即用。该示例仅返回包含 “excellent” 的评论。加载 Bright Data 的 SSL 证书。若需可靠的大规模数据采集,请考虑更高级的方案。可降低被谷歌反爬系统识别的概率。该示例将优先返回最低评分的评论。该示例将一次返回 20 条评论。:仅返回包含特定关键字的评论。

2026-07-31 08:00:00 184

原创 谷歌搜索 API

⚠️ 自 2025 年 1 月起,才能渲染搜索结果。此更新旨在阻止依赖非 JavaScript 方法的传统机器人、爬虫与 SEO 工具。因此,使用 Google 搜索进行市场研究或排名分析的企业必须采用支持 JavaScript 渲染的工具。

2026-07-29 08:00:00 233

原创 谷歌趋势爬虫 API

适合小规模数据采集项目的简易 Google Trends 爬虫。Google Trends 提供多种组件用于洞察数据。如果需要可靠、可规模化的数据采集,请考虑更高级的方案。加载 Bright Data 的 SSL 证书。提供可定制参数的结构化趋势数据。若省略则默认为全球趋势。获取解析后的 JSON。参数过滤特定国家的趋势数据(例如。可降低被谷歌反爬系统识别的概率。等参数说明见下方“高级功能”。注意:生产环境中,请按照我们的。若省略,默认为 Web 搜索。

2026-07-27 10:06:42 608

原创 Sephora 产品数据集示例

Email、API 下载、Webhook、Amazon S3、Google Cloud storage、Google Cloud PubSub、Microsoft Azure、Snowflake、SFTP。Bright Initiative 向领先的高校院系与研究人员、以及推动各类环境与社会公益事业的 NGO 和 NPO,提供对 Bright Data 的。识别 Sephora 产品库存缺口,分析特定产品需求的上升,并跟踪消费者中的趋势产品。一次、每日、每周、每月、每季度,或自定义。

2026-07-24 08:00:00 220

原创 Yandex 搜索爬虫

Yandex 使用严格且不断演进的反爬系统以阻止自动化数据提取。注意:使用原生代理方式时,生产环境建议安装 Bright Data 的 SSL 证书。若需可扩展且稳定的方案,请参考下方的 Bright Data 专用 API。最简单的方式是直接向 Bright Data 的 API 端点发起请求。,仅需一次 API 调用即可获取实时的 Yandex 搜索结果。Yandex 的每个 SERP 页面通常返回 10 条结果。该参数用于指定搜索结果所针对的地理区域或国家。隶属 Bright Data 的。

2026-07-22 08:00:00 872

原创 唯一! 亮数据 Bright Data 再次通过普华永道严苛审计,行业合规天花板就此诞生

亮数据 Bright Data 非常荣幸地向大家宣布:我们已成功完成由普华永道(PwC)主导的2025-2026年度合规与道德审计!这不仅仅是一份审计报告,更是一份沉甸甸的行业宣言——Bright Data 依然是行业内唯一一家接受"四大"会计师事务所如此严格外部审查的公司。别人只是"谈论"道德合规,而我们,是真正地"证明"它。💡 为什么这件事在此刻意义重大?住宅代理网络行业正在经历前所未有的变革:📰 媒体的监督持续加码🔍 网络安全研究日趋严谨⚠️ 多个不合规网络近期相继被关闭整个市场都在渴求透明度。

2026-07-20 09:18:55 320

原创 DuckDuckGo 搜索爬取器

注意:在生产环境中使用原生代理方式时,建议安装 Bright Data 的 SSL 证书。你希望在英国市场,面向移动端用户,监测竞争对手“500 英镑以下的预算笔记本”相关页面的定价。,仅用一次 API 调用即可获取实时 DuckDuckGo 搜索结果。模拟 Safari 浏览器,以便了解该平台上的展示与排名差异。如需可扩展且稳定的方案,请参考下文的专用 API 👇。🎯 这将获取“移动优先、已本地化、且为近期”的内容。,若已熟悉 Selenium,可继续阅读高级的。通过多种查询参数精准调优你的搜索结果。

2026-07-20 09:10:59 501

原创 电商竞争新时代:AI + 数据,才是真正的胜负手

监控 ChatGPT、Perplexity、Gemini、Grok、Bing Copilot、Google AI Mode 等主流AI引擎。在ChatGPT、Perplexity等AI搜索引擎大行其道的今天,您的品牌在AI眼中是什么形象?的权威认证(AIMultiple,2026年2月),正式推出面向AI时代的。结构化数据直接喂给您的AI大模型、智能体、价格引擎与AI助手,真正实现。追踪AI引擎对您品牌的提及方式、响应内容、排名及竞争对手数据。数据干净、结构化,随时可用于AI大模型训练与分析。

2026-07-17 08:00:00 332

原创 海量视频搜索采集,企业客户开放免费测试!

你有没有遇到过这种抓狂的时刻——脑子里明明有一个清晰的画面:夕阳下,一个穿红裙的女人在海滩上翩翩起舞……但你打开搜索框,愣是不知道敲什么关键词?🤦传统的视频搜索,靠的是——那些人写给搜索引擎看的文字。但视频里真正发生了什么?没人管。

2026-07-15 08:00:00 316

原创 【重要通知】动态住宅代理现已实施KYC专属验证 —— “即时访问“功能已全面取消

API错误说明(Add a Zone API)https://docs.brightdata.com/cn/api-reference/account-management-api/Add_a_Zone。| 访问政策 https://docs.brightdata.com/cn/proxy-networks/residential/network-access。• ❌ 原有的"即时访问"模式("smart-resi")已正式取消,新用户无法再绕过验证直接使用住宅代理。—— 无法创建或转换为住宅代理。

2026-07-13 10:06:49 287

原创 ASOS 数据集示例

一个包含 1000 多条记录的 ASOS 商品数据集示例。该数据集使用 Bright Data API 提取。还有更多。这是从 “ASOS products” 数据集中抽取的样本子集,完整数据集包含超过 260 万条记录。可用的数据集文件格式:JSON、NDJSON、JSON Lines、CSV 或 Parquet。可选地,文件可压缩为 .gz。数据集交付方式:电子邮件、API 下载、Webhook、Amazon S3、Google Cloud Storage、Google Cloud Pub/Sub、Mi

2026-07-03 08:00:00 276

原创 Best-Buy 数据集示例

一个包含 1000 多条记录的 Best Buy 商品数据集示例。该数据集使用 Bright Data API 提取。还有更多。这是从 “Best Buy products” 数据集中抽取的样本子集,完整数据集包含超过 26.6K 条记录。可用的数据集文件格式:JSON、NDJSON、JSON Lines、CSV 或 Parquet。可选地,文件可压缩为 .gz。数据集交付方式:电子邮件、API 下载、Webhook、Amazon S3、Google Cloud Storage、Google Cloud P

2026-07-01 08:00:00 283

原创 亮数据免费使用额度,每月循环,永久免费!

你是否曾经因为"需要先绑卡"或"不知道会不会乱扣费"而对一款好工具望而却步?亮数据(Bright Data)听到了你的声音。—— 无需信用卡,无需优惠码,无任何使用承诺。

2026-06-29 15:14:43 355

原创 eBay 数据集示例

包含 1001 条 eBay 商品的示例数据集一个包含 1000 多条记录的 eBay 商品数据集示例。该数据集使用 Bright Data API 提取。还有更多。这是从 “eBay products” 数据集中抽取的样本子集,完整数据集包含超过 251K 条记录。可用的数据集文件格式:JSON、NDJSON、JSON Lines、CSV 或 Parquet。可选地,文件可压缩为 .gz。数据集交付方式:电子邮件、API 下载、Webhook、Amazon S3、Google Cloud Storage、

2026-06-29 08:00:00 346

原创 Etsy 数据集示例

一个包含 1000 多条记录的 Etsy 商品数据集示例。该数据集使用 Bright Data API 提取。还有更多。这是从 “Etsy products” 数据集中抽取的样本子集,完整数据集包含超过 810 万条记录。可用的数据集文件格式:JSON、NDJSON、JSON Lines、CSV 或 Parquet。可选地,文件可压缩为 .gz。数据集交付方式:电子邮件、API 下载、Webhook、Amazon S3、Google Cloud Storage、Google Cloud Pub/Sub、Mi

2026-06-26 09:11:20 350

原创 H&M 数据集示例

包含 1001 条 H&M 商品的示例数据集一个包含 1000 多条记录的 H&M 商品数据集示例。该数据集使用 Bright Data API 提取。还有更多。这是从 “H&M products” 数据集中抽取的样本子集,完整数据集包含超过 410 万条记录。可用的数据集文件格式:JSON、NDJSON、JSON Lines、CSV 或 Parquet。可选地,文件可压缩为 .gz。数据集交付方式:电子邮件、API 下载、Webhook、Amazon S3、Google Cloud Storage、Goo

2026-06-22 08:00:00 367

原创 Home-Depot 数据集示例

一个包含 1000 多条记录的 Home Depot 商品数据集示例。该数据集使用 Bright Data API 提取。还有更多。这是从 “Home Depot products” 数据集中抽取的样本子集,完整数据集包含超过 350 万条记录。可用的数据集文件格式:JSON、NDJSON、JSON Lines、CSV 或 Parquet。可选地,文件可压缩为 .gz。数据集交付方式:电子邮件、API 下载、Webhook、Amazon S3、Google Cloud Storage、Google Clou

2026-06-19 08:00:00 342

Bright Data 抓取浏览器 Playwright 项目

Bright Data 抓取浏览器 Playwright 项目

2026-08-19

Bright Data ChatGPT 搜索抓取器(Python)

Bright Data ChatGPT 搜索抓取器(Python)

2026-08-19

Bright Data ChatGPT 搜索爬取器(Node.js)

Bright Data ChatGPT 搜索爬取器(Node.js)

2026-08-19

面向 Bing 的 Bright Data SERP API Python 项目

面向 Bing 的 Bright Data SERP API Python 项目

2026-08-19

Bright Data 异步 Web Unlocker Node.js 项目

Bright Data 异步 Web Unlocker Node.js 项目

2026-08-19

Zillow 数据抓取器

Zillow 数据抓取器

2026-05-29

Zara 数据集示例下载

Zara 数据集示例下载

2026-05-29

YouTube 数据集示例

YouTube 数据集示例

2026-05-29

Wildberries 数据集示例

Wildberries 数据集示例

2026-05-29

Webmotors 数据集示例下载

Webmotors 数据集示例下载

2026-05-29

Twitter(X)数据爬虫 - 由 Bright Data 提供

Twitter(X)数据爬虫 - 由 Bright Data 提供

2026-05-29

Social media 社交媒体数据集示例

Social media 社交媒体数据集示例

2026-05-29

Python 网页抓取指南

Python 网页抓取指南

2026-05-29

Home-Depot 数据集示例

Home-Depot 数据集示例

2026-05-29

H&M 电商数据集示例下载

H&M 电商数据集示例下载

2026-05-29

Etsy 数据集示例下载

Etsy 数据集示例下载

2026-05-29

eBay 数据集示例下载

eBay 数据集示例下载

2026-05-29

Best-Buy 数据集示例

Best-Buy 数据集示例

2026-05-29

ASOS 数据集示例下载

ASOS 数据集示例下载

2026-05-29

Zoopla 数据集示例

Zoopla 数据集示例

2026-04-08

Zalando 数据集示例

Zalando 数据集示例

2026-04-08

Yahoo Finance 数据集示例

Yahoo Finance 数据集示例

2026-04-08

Xing 数据集示例下载包

Xing 数据集示例下载包

2026-04-08

Tokopedia 数据集示例

Tokopedia 数据集示例

2026-04-08

Reddit 数据集示例

Reddit 数据集示例

2026-04-08

Myntra 数据集示例

Myntra 数据集示例

2026-04-08

Mouser 数据集示例

Mouser 数据集示例

2026-04-08

LinkedIn 个人资料数据集示例

LinkedIn 个人资料数据集示例

2026-04-08

宜家数据集示例下载包,下载包

宜家数据集示例下载包,下载包

2026-04-08

Google Shopping 数据集示例下载包

Google Shopping 数据集示例下载包

2026-04-08

BrightFlow BrightFlow BrightFlow

BrightFlow BrightFlow BrightFlow

2026-08-19

Bright Data 抓取浏览器 Node.js Selenium 项目

Bright Data 抓取浏览器 Node.js Selenium 项目

2026-08-19

Bright Data TrendScan

Bright Data TrendScan

2026-08-19

n8n-nodes-brightdata

n8n-nodes-brightdata

2026-08-19

Browserai MCP,为 AI 代理赋能实时网页数据

Browserai MCP,为 AI 代理赋能实时网页数据

2026-08-19

Bright Data Web Unlocker Node.js 项目

Bright Data Web Unlocker Node.js 项目

2026-08-19

Bright Data 解锁 Webhook 演示

Bright Data 解锁 Webhook 演示

2026-08-19

Bright Data Unlocker + AWS S3 Node.js 示例

Bright Data Unlocker + AWS S3 Node.js 示例

2026-08-19

Bright Data SDK

Bright Data SDK

2026-08-19

Bright Data 抓取浏览器 Puppeteer 项目

Bright Data 抓取浏览器 Puppeteer 项目

2026-08-19

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除