导入XML作为数据帧的各个领域（和子）(Import all fields (and subfiel

做了一些分析，我想导入XML使用R和XML封装的数据帧。 XML文件的实例：

<watchers shop_name="TEST" created_at="September 14, 2012 05:44">
<watcher channel="Site Name">
    <code>123456</code>
    <search_key>TestKey</search_key>
    <date>September 14, 2012 04:15</date>
    <result>Found</result>
    <link>http://www.test.com/fakeurl</link>
    <price>100.0</price>
    <shipping>0.0</shipping>
    <origposition>0</origposition>
    <name>Name Test</name>
    <results>
        <result position="1">
            <c_name>CTest1</c_name>
            <c_price>599.49</c_price>
            <c_shipping>0.0</c_shipping>
            <c_total_price>599.49</c_total_price>
            <c_rating>8.3</c_rating>
            <c_delivery/>
        </result><result position="2">
            <c_name>CTest2</c_name>
            <c_price>654.0</c_price>
            <c_shipping>0.0</c_shipping>
            <c_total_price>654.0</c_total_price>
            <c_rating>9.8</c_rating>
            <c_delivery/>
        </result>
        <result position="3">
            <c_name>CTest3</c_name>
            <c_price>654.0</c_price>
            <c_shipping>0.0</c_shipping>
            <c_total_price>654.0</c_total_price>
            <c_rating>8.8</c_rating>
            <c_delivery/>
        </result>
    </results>
</watcher>
</watchers>

我想有一个包含以下字段数据框的行：

shop_name   created_at  code    search_key  date    result
link    price   shipping    origposition    name    
position    c_name  c_price c_shipping  c_total_price   
c_rating    c_delivery

这意味着该子节点必须考虑为好，这将导致三排在这个例子中一个数据帧（因为结果表明3个位置）。田野

shop_name   created_at  code    search_key
date    result  link    price   shipping    
origposition    name

对于这些行的每个是相同的。

我可以去通过XML文件，但我无法得到一个数据帧与我想要的字段。当我将数据帧转换为数据框，我得到了以下字段：

"code"       "search_key"      "date"     "result"  
"link" "price"      "shipping"   "origposition"  
"name"    "results"

这里的字段

shop_name   created_at

缺少开头和“结果”被一起放在下栏“结果”的字符串。

它必须能够得到想要的数据帧，但我不知道如何准确地做到这一点。

UPDATE

通过@MvG提供的解决方案出色的作品对上述测试的XML文件。然而，列“结果”也可以有值“未找到”。该值项会错过某些字段（总是相同的申请），因此运行的解决方案时产生“的参数列数不匹配”误差。我想可以把这些条目中数据帧为良好，不存在空着的领域。我不明白如何将这一情况。

的test.xml

<watchers shop_name="TEST" created_at="September 14, 2012 05:44">
<watcher channel="Site Name">
    <code>123456</code>
    <search_key>TestKey</search_key>
    <date>September 14, 2012 04:15</date>
    <result>Found</result>
    <link>http://www.test.com/fakeurl</link>
    <price>100.0</price>
    <shipping>0.0</shipping>
    <origposition>0</origposition>
    <name>Name Test</name>
    <results>
        <result position="1">
            <c_name>CTest1</c_name>
            <c_price>599.49</c_price>
            <c_shipping>0.0</c_shipping>
            <c_total_price>599.49</c_total_price>
            <c_rating>8.3</c_rating>
            <c_delivery/>
        </result><result position="2">
            <c_name>CTest2</c_name>
            <c_price>654.0</c_price>
            <c_shipping>0.0</c_shipping>
        <c_total_price>654.0</c_total_price>
        <c_rating>9.8</c_rating>
        <c_delivery/>
    </result>
    <result position="3">
        <c_name>CTest3</c_name>
        <c_price>654.0</c_price>
        <c_shipping>0.0</c_shipping>
        <c_total_price>654.0</c_total_price>
        <c_rating>8.8</c_rating>
        <c_delivery/>
    </result>
</results>
</watcher>
<watcher channel="Shopping">
    <code>12804</code>
    <search_key></search_key>
    <date></date>
    <result>Not found</result>
    <link>https://www.test.com/testing1323p</link>
    <price>0.0</price>
    <shipping>0.0</shipping>
    <origposition>0</origposition>
    <name>MOOVM6002020</name>
    <results>
    </results>
</watcher>
</watchers>

Answer 1:

这里是一个更通用的方法。每个节点都被归为以下三种情况之一：

如果节点名称是一种rows ，然后从子节点的数据帧将导致结果的不同行。
如果节点名称是种cols ，然后从子节点的数据帧将导致结果的不同列。
如果节点名是种value ，然后使用一个值的数据帧将被构建，使用节点名称作为列名和节点值作为该列的值。
对于所有的三种情况下，节点的属性将被添加到所述数据帧。

呼吁您的应用程序向底部给出。

library(XML)

zeroColSingleRow <- function() {
  res <- data.frame(dummy=NA)
  res$dummy <- NULL
  stopifnot(nrow(res) == 1, ncol(res) == 0)
  return (res)
}

xml2df <- function(node, classifier) {
  if (! inherits(node, c("XMLInternalElementNode", "XMLElementNode"))) {
    return (zeroColSingleRow())
  }
  kind <- classifier(node)
  if (kind == "rows") {
    cdf <- lapply(xmlChildren(node), xml2df, classifier)
    if (length(cdf) == 0) {
      res <- zeroColSingleRow()
    }
    else {
      names <- unique(unlist(lapply(cdf, colnames)))
      cdf <- lapply(cdf, function(i) {
        missing <- setdiff(names, colnames(i))
        if (length(missing) > 0) {
          i[missing] <- NA
        }
        return (i)
      })
      res <- do.call(rbind, cdf)
    }
  }
  else if (kind == "cols") {
    cdf <- lapply(xmlChildren(node), xml2df, classifier)
    if (length(cdf) == 0) {
      res <- zeroColSingleRow()
    }
    else {
      res <- cdf[[1]]
      if (length(cdf) > 1) {
        for (i in 2:length(cdf)) {
          res <- merge(res, cdf[[i]], by=NULL)
        }
      }
    }
  }
  else {
    stopifnot(kind == "value")
    res <- data.frame(xmlValue(node))
    names(res) <- xmlName(node)
  }
  if (ncol(res) == 0) {
    res <- zeroColSingleRow()
  }
  attr <- xmlAttrs(node)
  if (length(attr) > 0) {
    attr <- do.call(data.frame, as.list(attr))
    res <- merge(attr, res, by=NULL)
  }
  rownames(res) <- NULL
  return(res)
}

doc<-xmlParse("test.xml")

xml2df(xmlRoot(doc), function(node) {
  name <- xmlName(node)
  if (name %in% c("watchers", "results"))
    return("rows")
  # make sure to treat results/result different from watcher/result
  if (name %in% c("watcher", "result") &&
      xmlName(xmlParent(node)) == paste0(name, "s"))
    return("cols")
  return("value")
})

Answer 2:

这是一种可能性：

attr2df <- function(n) do.call(data.frame, as.list(xmlAttrs(n)))
cbind(attr2df(xmlRoot(doc)), 
  do.call(rbind, xpathApply(doc, "//watcher", function(w) {
    x <- xmlToDataFrame(nodes = list(w))
    x$results<-NULL
    cbind(attr2df(w), x,
          xmlToDataFrame(nodes = getNodeSet(w, "results/result")))
  } ))
)

遍历所有的观察者。对于每一个观察者，读取其子树的数据帧x ，并读取其结果节点到另一个数据帧。从第一数据帧中删除的结果，那么这两个的列结合在一起，并且在从观察者的属性奉送。此应用程序将产生每一个观察者data.frame，并且外rbind CAL将它们组合到单个数据帧。最外层cbind将添加根节点的属性。

其结果将有这些名字：

 [1] "shop_name"     "created_at"    "channel"       "code"         
 [5] "search_key"    "date"          "result"        "link"         
 [9] "price"         "shipping"      "position"      "name"         
[13] "c_name"        "c_price"       "c_shipping"    "c_total_price"
[17] "c_rating"      "c_delivery"

文章来源: Import all fields (and subfields) of XML as dataframe