DOM应用---遍历网页中的元素

一、摘要
  在我们编写的程序中,如果想要实现对浏览器打开的网页进行监视、模拟操纵、动态提取用户输入、动态修改......等功能,那么请你抽出宝贵的时间,继续往下阅读。本文介绍的知识和示例程序都是围绕如何遍历 HTML 中的表单(form)并枚举出表单域的属性为目标的,对于网页中的其它元素,比如图象、连接、脚本等等,应用同样的方法都可以轻松实现。

二、网页的文档层次结构
  IE 浏览器,采用 DOM(文档对象模型)来管理网页的数据。它通过一个容器(IWebBrowser2/IHTMLWindow2)来装载网页文档(IHTMLDocument2),而一个文档,又可以由 0 或多个贞(frame)组成,管理这些贞的接口叫“框架集合(IHTMLFramesCollection2)”,而每个贞的容器又是IHTMLWindow2,和IWebBrowser2一样,它也装载着各自的文档(IHTMLDocument2)。因此,我们的第一个任务,就是想方设法能够得到IHTMLDocument2的接口。因为文档可能包含贞,而贞又包含着子文档,子文档可能再包含贞......,如此要得到所有的文档,这里有一个递归遍历的处理过程。
  得到文档(IHTMLDocument2)后,下一步任务就是要设法取得表单了(IHTMLFormElement)。因为在一个文档中可以包含 0 或多个表单(form),而管理这些表单的又是一个表单集合(IHTMLElementCollection),所以必须先得到集合,然后再枚举出所有的表单条目了。
  得到表单(IHTMLFormElement)后,接下来的事情就简单了,逐个提取表单中的元素(也叫表单域 IHTMLInputElement)就可以读写这些域的属性了。
  说了半天,我估计初次接触的朋友一定没有听懂:( 呵呵,还是用图的方式表示一下吧,这样比较清晰一些。

三、程序实现

<1> 取得 IHTMLDocument2 的接口指针。根据IE浏览器的运行方式,有多种不同的方式可以获取文档指针。
<1.1> 如果你在程序中使用MFC的 CHtmlView 视来浏览网页。
        取得文档的方法最简单,调用 CHtmlView::GetHtmlDocument() 函数。
<1.2> 如果你的程序中使用了“Web 浏览器” 的ActiveX 控件。
        取得文档的方法也比较简单,调用 CWebBrowser2::GetDocument() 函数。
<1.3> 如果你的程序是用 ATL 写的 ActiveX 控件。
        那么需要调用 IOleClientSite::GetContainer 得到 IOleContainer 接口,然后就可以通过 QueryInterface() 查询得到 IHTMLDocument2 的接口。主要代码如下:

CComPtr < IOleContainer > spContainer;
m_spClientSite->GetContainer( &spContainer );
CComQIPtr < IHTMLDocument2 > spDoc = spContainer;
if ( spDoc )
{
     // 已经得到了 IHTMLDocument2 的接口指针
}

<1.4> 如果你的程序是用 MFC 写的 ActiveX 控件。
        那么需要调用 COleControl::GetClientSite() 得到 IOleContainer 接口,然后的操作和<1.3>是一致的了。
<1.5> IE 浏览器作为独立的进程正在运行。
        每个运行的浏览器(IE 和 资源浏览器)都会在 ShellWindows 中进行登记,因此我们要通过 IShellWindows 取得实例(示例程序中使用的就是这个方法)。主要代码如下:

#include < atlbase.h >
#include < mshtml.h >

void FindFromShell() 
{
 CComPtr< IShellWindows > spShellWin;
 HRESULT hr = spShellWin.CoCreateInstance( CLSID_ShellWindows );
 if ( FAILED( hr ) )    return;

 long nCount=0;
 spShellWin->get_Count(&nCount);   // 取得浏览器实例个数

 for(long i=0; i<nCount; i++)
       {
              CComPtr< IDispatch ><nCount; i++)
 {
  CComPtr< IDispatch ><nCount; i++)
       {
              CComPtr< IDispatch > spDisp;
  hr=spShellWin->Item(CComVariant( i ), &spDisp );
  if ( FAILED( hr ) )   continue;

  CComQIPtr< IWebBrowser2 > spBrowser = spDisp;
  if ( !spBrowser )     continue;

  spDisp.Release();
  hr = spBrowser->get_Document( &spDisp );
  if ( FAILED ( hr ) )  continue;

  CComQIPtr< IHTMLDocument2 > spDoc = spDisp;
  if ( !spDoc )         continue;

  // 程序运行到此,已经找到了 IHTMLDocument2 的接口指针
 }
}

<1.6> IE 浏览器控件被一个进程包装在一个子窗口中。那么你首先要得到那个进程的顶层窗口句柄(使用 FindWindow() 函数,或其它任何可行的方法),然后枚举所有子窗口,通过判断窗口类名是否是“Internet Explorer_Server”,从而得到浏览器的窗口句柄,再向窗口发消息取得文档的接口指针。主要代码如下:

#include < atlbase.h >
#include < mshtml.h >
#include < oleacc.h >
#pragma comment ( lib, "oleacc" )

BOOL CALLBACK EnumChildProc(HWND hwnd,LPARAM lParam)
{
 TCHAR szClassName[100];

 ::GetClassName( hwnd,  &szClassName,  sizeof(szClassName) );
 if ( _tcscmp( szClassName,  _T("Internet Explorer_Server") ) == 0 )
 {
  *(HWND*)lParam = hwnd;
  return FALSE;  // 找到第一个 IE 控件的子窗口就停止
 }
 else return TRUE;  // 继续枚举子窗口
};

void FindFromHwnd(HWND hWnd) 
{
 HWND hWndChild=NULL;
 ::EnumChildWindows( hWnd, EnumChildProc, (LPARAM)&hWndChild );
 if(NULL == hWndChild) return;

 UINT nMsg = ::RegisterWindowMessage( _T("WM_HTML_GETOBJECT") );
 LRESULT lRes;
 ::SendMessageTimeout( hWndChild, nMsg, 0L, 0L, SMTO_ABORTIFHUNG, 1000, (DWORD*) &lRes );

 CComPtr < IHTMLDocument2 > spDoc;
 HRESULT hr = ::ObjectFromLresult ( lRes, IID_IHTMLDocument2, 0 , (LPVOID *) &spDoc );
 if ( FAILED ( hr ) ) return;

 // 程序运行到此,已经找到了 IHTMLDocument2 的接口指针
}

<2> 得到了 IHTMLDocument2 接口指针后,如果网页是单贞的,那么转第<4>步骤。如果是多贞(有子框架)则还需要遍历所有的子框架。这些子框架(IHTMLWindow2),被保存在集合中(IHTMLFramesCollection2),取得集合指针的方法比较简单,取属性 IHTMLDocument2::get_frames()。
<3> 首先取得子框架的总数目 IHTMLFramesCollection::get_length(),接着就可以循环调用 IHTMLFramesCollection::item()函数一个一个地取得子框架 IHTMLWindow2 指针,然后转第<1>步。
<4> 一个文档中可能拥有多个表单,因此还是同样的道理,先要取得表单的集合(IHTMLElementCollection,其实这个不光是表单的集合,其他元素的集合,比如图片集合也是用它)。这个操作也很简单,取得属性 IHTMLDocument2::get_forms()。
<5> 属性 IHTMLElementCollection::get_length() 得到表单总数目,就可以循环取得每一个表单指针了 IHTMLElementCollection::item()。
<6> 在第<5>步中的item()函数,得到的是一个IDispatch的指针,你通过QueryInterface()查询,就可以得到 某类型输入的指针,代码如下:

// 假设 spDisp 是由IHTMLElementCollection::item() 得到的 IDispatch 指针
CComQIPtr < IHTMLInputTextElement >     spInputText(spDisp);
CComQIPtr < IHTMLInputButtonElement >   spInputButton(spDisp);
CComQIPtr < IHTMLInputHiddenElement >   spInputHidden(spDisp);
......
if ( spInputText )
{
   //如果是文本输入表单域
}
else if ( spInputButton )
{
   //如果是按纽输入表单域
}
else if ( spInputHiddent )
{
   //如果是隐藏输入表单域
}
else if ........    //其它输入类型

  上面的方法,由于使用具体类型的接口指针,因此程序的效率比较高。但是通过 QueryInterface 接口查询,然后再进行条件判断显然是比较烦琐的,所以这个方法适合于特定的已知网页设计内容的程序。在示例程序中,我则是直接使用 IDispatch 接口进行操作的,这个方式执行起来稍微慢一些,但程序比较简单。主要代码和说明如下:

#include < atlbase.h >
CComModule  _Module; // 由于需要使用 CComDispatchDriver 的 IDispatch 包装类ATL智能指针,所以这个是必须的
#include < atlcom.h >
......
long nElemCount=0;  //表单域的总数目
spFormElement->get_length( &nElemCount );

for(long j=0; j< nElemCount; j++)
{
 CComDispatchDriver spInputElement; // IDispatch 的智能指针
 spFormElement->item( CComVariant( j ), CComVariant(), &spInputElement );

 CComVariant vName,vVal,vType; // 域名称,域值,域类型
 spInputElement.GetPropertyByName( L"name", &vName );
 spInputElement.GetPropertyByName( L"value",&vVal  );
 spInputElement.GetPropertyByName( L"type", &vType );
 // 使用 IDispatch 的智能指针的好处就是:象上面这样读取、设置属性很简单
 // 另外调用 Invoke 函数也异常方便,Invoke0(),Invoke1(),Invoke2()....
 ......
}

四、结束语
  示例程序在 VC6 下编译执行通过。运行方法:随便启动几个 IE 浏览网页,最好是有表单输入的网页。然后执行示例的 EXE 程序即可。到这里,就到这里了......祝大家学习快乐 ^-^

 

var 
input:OleVariant; 
Doc:IHTMLDocument2; 
ihtext:ihtmlinputelement; 
begin 
doc:=webbrowser1.document as ihtmldocument2; 
ihtext:=(doc.all.item( &apos;userValidateCode &apos;,0) as ihtmlinputelement); 
ihtext.value:=codenum; 
input:=doc.all.item( &apos;submit &apos;,0); 
input.click; 
end;

 

关于这个的实现网上也蛮多,总结了一下,也就两种,一种是POST,一种就是直接操纵网页元素,前者速度快,但是对于某些网站很麻烦,因为要提交很多隐藏的东西,第二种就方便多了,对于任何的网页都可以的,但是速度远不如第一种, 两种方法在网上都很好找,这里我给出第二种的做法(其实上篇文章里就有关于POST的一些东西).

我写了两个函数来实现,一个是填写相关的输入框,一个是提交,聪明的你应该可以根据这写出更多实用的代码出来,看代码:

 


/****************************************************/
// 输入到设置的网页对象句柄,输入框的标识,要填写的字符串
/****************************************************/
void  SetIEText(IHTMLDocument2  * pDocument,CString strID,CString strText)
{
     IHTMLElementCollection 
*AllElement=NULL;//保存网页所有元素
    
     pDocument
->get_all(&AllElement); //得到网页所有元素的集合
     CComPtr<IDispatch> pDisp; //保存需要设定的对象
     AllElement->item(COleVariant(strID),COleVariant((long)0),&pDisp);//返回指定ID的对象
     CComQIPtr<IHTMLInputTextElement,   &IID_IHTMLInputTextElement> pElement;//输入框的指针
    if(pDisp==NULL)
    
{
         AfxMessageBox(
"没有找到你要的资源!"); 
     }

    
else
    
{
         pElement
=pDisp; 
         pElement
->put_value(strText.AllocSysString()); //这里设置输入网的值
     }

    
}


/****************************************************/
// 输入到设置的网页对象句柄,按钮的标识
/****************************************************/
void  Submit(IHTMLDocument2  * pDocument,CString strID)
{
     IHTMLElementCollection 
*AllElement=NULL;//保存网页所有元素
    
     pDocument
->get_all(&AllElement); //得到网页所有元素的集合
     CComPtr<IDispatch> pDisp; 
     AllElement
->item(COleVariant(strID),COleVariant((long)0),&pDisp);//返回指定ID的对象
     CComQIPtr<IHTMLElement, &IID_IHTMLElement> pElement;
    
if(pDisp==NULL)
    
{
         AfxMessageBox(
"没有找到你要的资源!"); 
     }

    
else
    
{
         pElement
=pDisp;
         pElement
->click();
     }

}
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
众所周知,人工智能是当前最热门的话题之一, 计算机技术与互联网技术的快速发展更是将对人工智能的研究推向一个新的高潮。 人工智能是研究模拟和扩展人类智能的理论与方法及其应用的一门新兴技术科学。 作为人工智能核心研究领域之一的机器学习, 其研究动机是为了使计算机系统具有人的学习能力以实现人工智能。 那么, 什么是机器学习呢? 机器学习 (Machine Learning) 是对研究问题进行模型假设,利用计算机从训练数据学习得到模型参数,并最终对数据进行预测和分析的一门学科。 机器学习的用途 机器学习是一种通用的数据处理技术,其包含了大量的学习算法。不同的学习算法在不同的行业及应用能够表现出不同的性能和优势。目前,机器学习已成功地应用于下列领域: 互联网领域----语音识别、搜索引擎、语言翻译、垃圾邮件过滤、自然语言处理等 生物领域----基因序列分析、DNA 序列预测、蛋白质结构预测等 自动化领域----人脸识别、无人驾驶技术、图像处理、信号处理等 金融领域----证券市场分析、信用卡欺诈检测等 医学领域----疾病鉴别/诊断、流行病爆发预测等 刑侦领域----潜在犯罪识别与预测、模拟人工智能侦探等 新闻领域----新闻推荐系统等 游戏领域----游戏战略规划等 从上述所列举的应用可知,机器学习正在成为各行各业都会经常使用到的分析工具,尤其是在各领域数据量爆炸的今天,各行业都希望通过数据处理与分析手段,得到数据有价值的信息,以便明确客户的需求和指引企业的发展。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值