
文章目录前言重构采集流程完整工程代码更多采集场景SERP API网页采集 API通用采集 API数据集市场Dashboard 控制台总结前言大家好我是颜颜yan_。最近在做视频数据采集项目时遇到了各种实际问题。页面大量使用动态加载数据并不在初始 HTML 中需要分析页面结构或调用内部接口。更麻烦的是页面结构经常变化之前写好的解析规则过一段时间就会失效。批量采集时网络异常问题更加明显IP 限制、频率控制、浏览器环境检测接连出现。为了应对这些又得维护代理池、请求重试、Cookie 管理等一堆基础设施。重构采集流程重新调整方案后稳定性和效率都提升了不少。现在我的整个流程变成搜索关键词→ 获取视频链接 → 提交采集任务 → 获取结构化数据 → 进入分析流程。我把最重要的采集部分交给了 Dataify只在工程里保留搜索入口 链接提取这部分逻辑。我在Dataify中把对应链接设置好设置好参数。右侧就会出现对应的代码直接把这个模板代码接入到我的工程代码里面。importrequests urlhttps://scraperapi.dataify.com/builderheaders{Authorization:你的API key,Content-Type:application/x-www-form-urlencoded,}data{spider_name:youtube.com,spider_id:youtube_video_by-url,spider_parameters:[{url:https://www.youtube.com/watch?v_SdpvpvVrLY}],spider_universal:{resolution:360p,video_codec:vp9,audio_format:opus,bitrate:320,subtitles_language:ab,selected_only:false},spider_errors:true,file_name:{{TasksID}},}responserequests.post(url,headersheaders,datadata)print(response.text)我运行后在Dataify任务列表就可以看到对应任务。完成任务后在 Dashboard 点击下载可导出 JSON、CSV、XLSX 三种格式的结果。从请求到最终结果只需要几秒钟方便多了。返回的元数据是已经清洗好的结构化字段包括标题、视频 ID、缩略图、播放量、发布时间、点赞数、频道信息、时长、描述、字幕状态、分辨率等。完整工程代码importargparseimportjsonimportosimportrefromhtmlimportunescapefromurllib.parseimporturlencodefromurllib.requestimportRequest,urlopen SEARCH_URLhttps://www.youtube.com/results?search_query%E9%AA%91%E8%A1%8C%E7%AC%AC%E4%B8%80%E8%A7%86%E8%A7%92DATAIFY_URLhttps://scraperapi.dataify.com/builderDATAIFY_TOKENos.getenv(DATAIFY_TOKEN,APIkey)DEFAULT_SCROLL_PAGES10VIDEO_ID_PATTERNre.compile(r/watch\?v([a-zA-Z0-9_-]{11}))API_KEY_PATTERNre.compile(rINNERTUBE_API_KEY\s*:\s*([^]))CLIENT_NAME_PATTERNre.compile(rINNERTUBE_CLIENT_NAME\s*:\s*([^]))CLIENT_VERSION_PATTERNre.compile(rINNERTUBE_CLIENT_VERSION\s*:\s*([^]))defmake_watch_url(video_id):returnfhttps://www.youtube.com/watch?v{video_id}defunique_links(video_links):links[]seenset()forlinkinvideo_links:iflinkinseen:continueseen.add(link)links.append(link)returnlinksdefextract_video_links(html):Return unique YouTube watch URLs in first-seen order.htmlunescape(html.replace(\\u0026,))returnunique_links(make_watch_url(video_id)forvideo_idinVIDEO_ID_PATTERN.findall(html))defextract_json_object(text,start_index):depth0in_stringFalseescapedFalseforindexinrange(start_index,len(text)):chartext[index]ifin_string:ifescaped:escapedFalseelifchar\\:escapedTrueelifchar:in_stringFalsecontinueifchar:in_stringTrueelifchar{:depth1elifchar}:depth-1ifdepth0:returntext[start_index:index1]raiseValueError(Could not find the end of the JSON object.)defextract_yt_initial_data(html):markerytInitialDatamarker_indexhtml.find(marker)ifmarker_index-1:returnNonestart_indexhtml.find({,marker_index)ifstart_index-1:returnNonereturnjson.loads(extract_json_object(html,start_index))defwalk_json(value):ifisinstance(value,dict):yieldvalueforchildinvalue.values():yieldfromwalk_json(child)elifisinstance(value,list):forchildinvalue:yieldfromwalk_json(child)defextract_video_links_from_data(data):video_ids[]foriteminwalk_json(data):videoitem.get(videoRenderer)ifnotisinstance(video,dict):continuevideo_idvideo.get(videoId)ifvideo_id:video_ids.append(video_id)returnunique_links(make_watch_url(video_id)forvideo_idinvideo_ids)defextract_continuation_token(data):foriteminwalk_json(data):commanditem.get(continuationCommand)ifisinstance(command,dict)andcommand.get(token):returncommand[token]continuationitem.get(nextContinuationData)ifisinstance(continuation,dict)andcontinuation.get(continuation):returncontinuation[continuation]returnNonedefextract_innertube_config(html):api_keyAPI_KEY_PATTERN.search(html)client_nameCLIENT_NAME_PATTERN.search(html)client_versionCLIENT_VERSION_PATTERN.search(html)return{api_key:api_key.group(1)ifapi_keyelseNone,client_context:{client:{clientName:client_name.group(1)ifclient_nameelseWEB,clientVersion:client_version.group(1)ifclient_versionelse2.20240701.00.00,}},}deffetch_search_html(search_url):headers{Accept-Language:zh-CN,zh;q0.9,en;q0.8,User-Agent:(Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0.0.0 Safari/537.36),}requestRequest(search_url,headersheaders)withurlopen(request,timeout30)asresponse:charsetresponse.headers.get_content_charset()orutf-8returnresponse.read().decode(charset,errorsreplace)deffetch_continuation_data(token,client_context,api_key):ifnotapi_key:raiseValueError(Could not find YouTube INNERTUBE_API_KEY in the search page.)bodyjson.dumps({context:client_context,continuation:token,}).encode(utf-8)requestRequest(fhttps://www.youtube.com/youtubei/v1/search?key{api_key},databody,headers{Content-Type:application/json,User-Agent:(Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0.0.0 Safari/537.36),},methodPOST,)withurlopen(request,timeout30)asresponse:charsetresponse.headers.get_content_charset()orutf-8returnjson.loads(response.read().decode(charset,errorsreplace))defget_search_video_links(search_url,limitNone,scroll_pages10,fetch_htmlfetch_search_html,fetch_continuationfetch_continuation_data,):htmlfetch_html(search_url)initial_dataextract_yt_initial_data(html)configextract_innertube_config(html)ifinitial_data:linksextract_video_links_from_data(initial_data)continuationextract_continuation_token(initial_data)else:linksextract_video_links(html)continuationNonefor_inrange(1,max(scroll_pages,1)):ifnotcontinuation:breakpage_datafetch_continuation(continuation,config[client_context],config[api_key])linksunique_links(linksextract_video_links_from_data(page_data))continuationextract_continuation_token(page_data)iflimitandlen(links)limit:breakiflimit:returnlinks[:limit]returnlinksdefbuild_spider_parameters(video_links):returnjson.dumps([{url:url}forurlinvideo_links],ensure_asciiFalse)defsubmit_to_dataify(video_links):ifnotvideo_links:raiseValueError(No YouTube video links found.)headers{Authorization:fBearer{DATAIFY_TOKEN},Content-Type:application/x-www-form-urlencoded,}data{spider_name:youtube.com,spider_id:youtube_video-post_by-url,spider_parameters:build_spider_parameters(video_links),spider_errors:true,file_name:{{TasksID}},}encoded_dataurlencode(data).encode(utf-8)requestRequest(DATAIFY_URL,dataencoded_data,headersheaders,methodPOST)withurlopen(request,timeout60)asresponse:charsetresponse.headers.get_content_charset()orutf-8returnresponse.read().decode(charset,errorsreplace)defprompt_scroll_pages(defaultDEFAULT_SCROLL_PAGES):whileTrue:valueinput(f请输入滚动页数直接回车默认{default}页: ).strip()ifnotvalue:returndefaulttry:pagesint(value)exceptValueError:print(请输入大于 0 的整数。)continueifpages0:returnpagesprint(请输入大于 0 的整数。)defparse_args():parserargparse.ArgumentParser(descriptionExtract YouTube search-result video links and submit them to Dataify.)parser.add_argument(--search-url,defaultSEARCH_URL,helpYouTube search result URL.)parser.add_argument(--limit,typeint,helpOnly submit the first N video links.)parser.add_argument(--scroll-pages,typeint,helpHow many search-result pages to read, including the initial page.,)parser.add_argument(--dry-run,actionstore_true,helpPrint links without submitting.)returnparser.parse_args()defmain():argsparse_args()scroll_pagesargs.scroll_pagesorprompt_scroll_pages()video_linksget_search_video_links(args.search_url,args.limit,scroll_pages)print(fFound{len(video_links)}video links:)forlinkinvideo_links:print(link)ifargs.dry_run:returnprint(submit_to_dataify(video_links))if__name____main__:main()更多采集场景SERP API除了视频数据Dataify 还覆盖了其他几类常见场景SERP API用于实时获取搜索引擎结果Google、Bing、DuckDuckGo 等包括自然搜索结果、广告位、People Also Ask 等 SERP Feature适合 SEO 监控、关键词排名和竞品分析。网页采集 API网页采集 API适合商品详情页、新闻文章、企业黄页等内容提交 URL 后可以处理 JS 渲染、反爬和数据返回输出格式支持 HTML、Markdown 或结构化 JSON。通用采集 API通用采集 API是长尾站点的兜底方案适合没有专门模板的站点。对于无法套用预置模板的网站可以通过通用接口发起请求由平台处理访问路由、浏览器指纹、JS 渲染和验证码等复杂流程。数据集市场Dataify 还提供数据集市场公开了 1000 数据集覆盖电商、社交媒体、音视频、AI 训练、金融、医疗、法律等多个方向。如果不想自己采集可以直接使用现成的数据集进行分析或训练。数据集类型使用场景电商数据集商品监控、评论分析、选品研究社交媒体数据集达人分析、内容趋势、舆情监测视频数据集视频推荐、内容理解、账号分析行业数据集AI 训练、行业研究、知识库构建Dashboard 控制台Dashboard 控制台集成了 API 管理创建、轮换 API Key查看调用配额、任务管理提交、查询和管理采集任务、数据集市场、代理资源监控和账单日志。整体来看它像是采集任务的驾驶舱能查看任务状态、响应时间、成功率、积分消耗和历史日志方便后续排查问题和评估采集稳定性。总结在视频数据采集项目中真正耗时是维护那些基础设施动态加载处理、页面结构适配、反爬应对、代理管理这些底层工作占据了大量精力。把这部分交给 Dataify 之后整个流程变得很直接搜索关键词、提取链接、提交任务、拿到结构化数据然后进入业务分析开发重心终于回到核心逻辑上。如果你也在做类似的数据采集项目不妨试试 Dataify。立即体验https://dataify.com?utm_sourceyyyanutm_term01我是颜颜yan_觉得好的话点个赞吧