BeautifulSoup获取特定列的所有值

5

我正在使用BeautifulSoup解析HTML。到目前为止,我的代码如下:

url = "http://routerpasswords.com"
data = {"findpass":"1", "router":"Belkin", "findpassword":"Find Password"}
post_data = urllib.urlencode(data)
req = urllib2.urlopen(url, post_data)
html_str = req.read()
parser = new BeautifulSoup(html_str)
table = parser.find("table")

有没有办法获取列 column 下所有单元格的列表? 这是一个例子: 如果我有这个表:

<table cellpadding="0" cellspacing="0" width="100%">
<thead>
<tr>
<th>Manufacturer</th>
<th>Model</th>
<th width="80">Protocol</th>
<th width="80">Username</th>
<th width="80">Password</th>
</tr>
</thead>
<tbody>
<tr>
<td><b>BELKIN</b></td>
<td>F5D6130</td>
<td>SNMP</td>
<td>(none)</td>
<td>MiniAP</td>
</tr>
<tr>
<td><b>BELKIN</b></td>
<td>F5D7150<i> Rev. FB</i></td>
<td>MULTI</td>
<td>n/a</td>
<td>admin</td>
</tr>
<tr>
<td><b>BELKIN</b></td>
<td>F5D8233-4</td>
<td>HTTP</td>
<td>(blank)</td>
<td>(blank)</td>
</tr>
<tr>
<td><b>BELKIN</b></td>
<td>F5D7231</td>
<td>HTTP</td>
<td>admin</td>
<td>(blank)</td>
</tr>
</tbody>
</table>

我如何获取用户名列中所有项目的列表? 我希望它们也是字符串。


你的HTML长什么样? - alvas
一秒钟,我会把它发布。 - 735Tesla
抱歉之前可能我表达不够清楚。我已经编辑了我的问题。 - 735Tesla
1个回答

4
from BeautifulSoup import BeautifulSoup
soup = BeautifulSoup(open("file.html",'r').read())
cols = [header.string for header in soup.find('thead').findAll('th')]
col_idx = cols.index('Username')
col_values = [td[col_idx].string 
              for td in [tr.findAll('td') 
                         for tr in soup.find('tbody').findAll('tr')]]
print(col_values)

结果为:

[u'(无)', u'n/a', u'(空)', u'管理员']


网页内容由stack overflow 提供, 点击上面的
可以查看英文原文,
原文链接