日期:2014-04-29  浏览次数:22700 次

所谓的xml,就是eXtensible Markup Language, 翻译成中文就是“可扩展标识言语“,在国内很多人理解xml为html的简单扩展,这实际上是一种误解。虽然xml同html关系非常密切。
  XML与SGML、HTML的关系。
   SGML、HTML是XML的先驱。SGML是指“通用标识言语标准”(Standard Generalized Markup Language), 它是国际上定义电子文件结构和内容描述的标准,是一种非常复杂的文档的结构,次要用于大量高度结构化数据的防卫区和其他各种工业领域,利于分类和索引。同XML相比,定义的功用很强大,缺点是它不适用于Web数据描述,而且SGML软件价格非常价格昂贵。   HTML置信大家都比较熟悉,即“HyperText Markup Language” (超文本标识言语),它的优点是比较适合web 页面的开发。但它有一个缺点是标记绝对少,只要固定的标记集如<p>.<strong>等。缺少sgml 的柔性和顺应性。不能支持特定领域的标记言语,如对数学、化学、音乐等领域的表示支持较少。举个例子来说,开发者很难在web pape 上表示数学公式、化学分子式和乐谱。
    Xml 结合了sgml 和html的优点并消弭其缺点。Xml 仍然被认为是一种sgml言语。比sgml要简单,但能实现sgml的大部分的功用。1996年的夏天,Sun Microssystem的John Bosak开始开发W3C SGML任务组(如今称为xml任务组)。他们的目标是创建一种sgml,使其在Web中,既能利用Sgml的长处,又保留html的简单性。如今目标基本达到。
  二、Xml 的发展。
    在专业领域中,出现了Web标记言语的许多项目,著名的有CML—化学标记言语,由Peter Murray_Rust 开发,同时开发了第一个通用xml 浏览器Jumbo . 在数学方面,包括IBM公司再内都在努力开发MathML 1997年四月,出版了xll的第一个版本。当xll完整实现时,将比html 和当前浏览器所达到的链接水平更复杂,更强大。1997年8月,Microsoft公司和Inso公司引入xsl.由于xml是纯结构和语义的,需求描述单个元素格式方法。可以使用html的CSS;另一种方案是xsl. 1998年1月,microsoft 公司出版发行了msxsl程序。可以利用xsl表和xml文档创建能被IE4 识别的html页面。1998年2月,W3C发布了xml1.0的正式版本。最近一年多来,由于网络使用的飞速发展,xml的发展非常迅猛。出现了DOM(Document Object Model),XSLT(XSL Transformation)等新名词,xml的使用软件也有了飞速的发展,Microsoft、IBM、Breeze、Stilo等公司纷纷推出了本人的或解析器,或开发平台。在MicrosoftIBM、HP等大公司的推动下,目前有两个著名的xml的研讨组织,分别是biztalk.com和oasis.org,由他们向W3C提出标准的建议。其中biztalk是有Microsoft牵头组织的,风趣的是Microsoft公司同时参加了oaisis,不过不同于IBM、HP等著名大公司,他的年费只交10万美元,用Microsoft发言人的话就是“一切视oasis的发展而定!“,言下之意就是如果oasis制定的标准抵触Microsoft的使用,一场标准大战不可避免。
  什么是XML
    首先XML是一种元标记言语,所谓“元标记”就是开发者可以依据本人的需求定义本人的标记,比如开发者可以定义如下标记<book> <name>,任何满足xml命名规则的名称都可以标记,这就为不同的使用程序打开了的大门。HTML是一种预定义标记言语,它只认识诸如<html>,<p>等曾经定义的标记,对于用户本人定义的标记是不认识的。 第二xml是一种语义/结构化言语。它描述了文档的结构和语义。举个例子,在和html中,要描述一本书,可以如下表示:
  <dt> book name
  <dd> author_name <ul> <li>publisher_name ;;;; <li>isbn_number <ul> 在xml中,同样的数据表示为 <book> <title>book name</title> <author>author name</author) <publisher> publisher name</publisher> <isbn>isbn_number</isbn> </book> 从上面的对比,可以看出,xml的文档是有明确语义并且是结构化的。 XML是一种通用的数据格式从低级的角度看,xml是一种简单的数据格式,是纯100%的ASCII文本,而ASCII的抗破坏能力是很强的。不象紧缩数据和java对象,只需破坏一个数据文件数据就不可阅读。 从高级的角度看,是一种自描述言语。
  XML可利用于数据交换 次要是由于XML表示的信息独立于平台的,这里的平台即可以理解为不同的使用程序也可以理解为不同的操作系统;它描述了一种规范,利用它Microsoft的word文档可以和Adobe 的Acrobat交换信息,可以和数据库交换信息。
  XML表示的结构化数据。
    对于大型复杂的文档,xml 是一种理想言语,不只允许指定文档中的词汇,还允许指定元素之间的关系。比如可以规定一个author元素必须有一个name子元素。可以规定企业的业务必须有包括什么子业务。
  XML文档。 XML文档有DTD和XML文本组成,所谓DTD(Document Type Definition ),简单的说就是一组标记符的语法规则.,表明XML文本是怎样样组织的,比如DTD可以表示一个<book>必须有一个子标记<author>, 可以有或者没有子标记<pages> 等等。当然一个简单的XML文本可以没有DTD。下面是一个简单的xml文本。 <? Xml version=”1.0” standalone=”yes”> <book> haha </book> 其中以?开始并结尾的是进程说明。Standalone表示外围设备。这里外围设备可以理解为该XML文本没有使用其他的文件。由于XML文件可以外部使用DTD等外部数据。
  XML 涉及的一些技术。
  XSL和CSS。
    通过前面的引见可以知道,XML可以定义信息的内容,却没有定义信息该如何表达,这实际上就是XML的长处,它把内容和方式分离了,这样同一个内容可以有不同的表达,置信随着XML使用的提高,那种“建议你使用800x600分辨率“的会消逝。而XML内容的表达就是通过XSL(XML Style Language)和CSS(Cascading Style Sheets 层叠款式表)来实现。拿前一个例子来说,可以为该xml文档定义的款式表(XSL)如下: <xsl> <rule> <root/> <H1> <children/> </H1> </rule> <xsl> 这就是一个简单的 XSL文件,利用msxsl可以生成html文件。如下 <h1> haha </hi> 至于CSS,在HTML文件中就曾经有它的影子了,例如 H1 { font-size: 12pt; font-weight: bold; } 这就是一段简单的CSS的文本。
  XML Schema 虽然DTD给标记的使用加了限制,但是对于XML的自动处理却还需求愈加严厉更全面的工具。比如DTD不能保证一个标记的某个属性的值必须不为负值,于是出现了XML Schema,由于XML Schema(不同于DTD)本身也是一个正轨的XML文档,因此开发者可以使用相反的工具处理其同其他的XML的信息交换。最后XML Schema由Microsoft提出,W3C 的专家们经过充分讨论和论证,在1999年的2月,发布了一个需求定义,说明Schema必须符合的要求,5月,W3C完成并发布了Schema的定义。目前,IE5中的XML解析器能够依据文档类型定义(DTD)或XML Schema解析XML
  关于DOM DOM即Document Object Model, 它把XML文档的内容实现为一个对象模型,简单的