编译原理之词法分析



词法分析:

编译程序的第一步工作,编译程序的一部分。

核心作用,将字符序列转化为计算机的内部表示

读出字符序列,逐个拼出单词,并构造相应的内部表示。

检查词法错误。

例如对于字符序列源文件,经过词法分析

if (position > 10) rate = 3.14 * initial;

则应该产生下面的内容。

<$if,->, <$open, ->, <$id, position>, <$gt, ->, <$num,10>

<$close,->, <$id, rate>, <$eq, ->, <$num, 3.14>, <$mult, ->,

<$id,initial><$semi, ->

 

词法分析器的接口:

1,仅仅作为语法分析的子程序

 

 

 

read

 

 

 

 

 

call

Src                                                       词法分析                                                                         语法分析

Char

 

 

 

 

 

Token

 

2 另一类作为编译器的独立一遍处理器

 

 src                                     char                    词法分析              Token            语法分析

 

 

在这里我们讲述一下单词的含义:

单词:指的是语言中具有独立含义的最小单位。对于上面的程序语句而言。

if (position > 10) rate = 3.14 * initial;

这条语句,在词法分析的阶段我们考录3.14这个字符序列。我们可以有多种单词构成。例如

3.14 * initial这三个部分,当然这是表达式乘积,但是倘若我们再进一步的把3.14分为3  .   14

这样的划分方式就不太合理了。因为对于我们而言,3.14作为一个具有独立含义的单位,表示数字

 

 

 

在一个程序中,单词可以分为下列几类:

 

保留字:-------while   do

 

标识符:identifier a, b , class T

 

Word

 

 

常量:

true

10 A

 

1 运算符        +  - *   /

 

2 界限符       { }

特殊符号:

3 格式符      EOF

 

 

 

 

那么如何实现词法程序:

需求:

描述方式

算法                                                                 正则表达式

 

单词的描述工具分为两种:

 

 

  自动机

 

字母表:。程序中所有可能出现的符号。   A / - j 等等

符号串:符号组成的任意有穷序列

 

 

计算机生成了可选文字:
空符号串(用。表示)是万上的符号串
若Q是万上的符号串,x是动勺元素,则xQ
是万上的符号串
3.p
和2导
万上的符号串,当且仅当它可以由1
是出

符号串的连接:

ɑ,β 分别为字母表组成的符号串,ɑ = abc β  = def

则两者的连接为:ɑβ  = abcdef

符号串的方幂

符号串集合的乘积

A B分别是两个符号串集合,其中A = {ab, cd}, B = {ef, gh}

AB的的乘积还是一个集合{abef,abgh, cdef, cdgh}

 

而方幂则表示为

假如符号串集合为A = {a, b}

则A0={e}, A1=A,  A2=AA, …, An=AA… A

 

 

A3次方幂为AAA = (AA)A ={aa, ab, ba, bb}{a, b} = {aaa, aba, baa, bba, aab, abb, bab, bbb}

 

符号串的正闭包

A是符号串集合,则A+称为符号串集合A的正闭包

A+ = A+=A1A2A3 …An…

 

符号串集合的的星闭包

 

A* =A0A1A2A3 …An…=A0A+

 

 

正则表达式的定义:

为字母表,RE为定义在的正则表达式,则有

计算机生成了可选文字:
一,
一2·
一3·
g,。任RE;
对于任意符号a任万
,则a任RE
若r,s任RE
r·S任RE
,则r}s任RE,
,r*任RE;

 

 

 

正则表达式对应的语义解释被称作正则集,正则集也是正则表达式所对应的语言。

在词法分析中,正则表达式是针对单词进行描述的,为此,我们要建立一种从正则表达式到字符串集合的映射关系。

使得正则表达式的语义解释描述成字符串的形式。

 

e, e1, e2上的正则表达式,则e所对应的正则集L(e)取值如下:

计算机生成了可选文字:
·当e=O时,以e)=O;
·当e=。时,L(e)={。};
·对于艺中一个字符a,若e二a,则以e)二{a};
·当e=el·eZ时,L(e)=L(el)L(eZ);
·当e=el}eZ时,L(e)=L(el)UL(eZ);
·L(e*)=L(e)*;
.L(e+)=L(e)+.

 

 

 

 

 

正则表达式的性质:

+ = * >  . > |   运算优先级

A | B = B | A

A | (B | C) = A ( B | C)        |的可结合性

A|(BC) = (AB) | (AC)   连接的可分配性

A** = A*                 幂的等价性

 

用正则表达式表示描述词法:

L= A|BC|D|……|a|b|……|z

D = 0|1|2|……|9    D1 = 1|2|3|……|9

 

标识符:(L|(L|D)*

常数:    +|-|Φ|D1D*|0

实数:   +|-|Φ|D1D*|0.D*

 

特殊符号:使用枚举

保留字:   while | if | do|……

运算符:  +|-|*|……

分界符: { | } | |……

控制符:   \t   \n 

 

 

当然正则表达式不仅仅可以用于词法分析也可以在其它的地方使用,例如手机号码归属地,程序分析技术等等。

 

正则表达式的局限性:

正则表达式缺乏对对称性字符串的表达能力。

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值