JAVAはウェブページの画像をキャプチャし、JAVAは正規表現を利用してウェブサイトの画像をキャプチャします。
3213 ワード
javaを利用してホームページ上のすべての写真をキャプチャします。
二つの正規表現を使います。
1、htmlの中のタグの正則に合致しています。
2、crcのhttp経路にマッチする正則:http:\"?(.*?)(\"124;;>|\\\"s+)
実装:
二つの正規表現を使います。
1、htmlの中のタグの正則に合致しています。
2、crcのhttp経路にマッチする正則:http:\"?(.*?)(\"124;;>|\\\"s+)
実装:
package org.swinglife.main;
import java.io.File;
import java.io.FileOutputStream;
import java.io.InputStream;
import java.net.URL;
import java.net.URLConnection;
import java.util.ArrayList;
import java.util.List;
import java.util.regex.Matcher;
import java.util.regex.Pattern;
/***
* java
* @author swinglife
*
*/
public class CatchImage {
//
private static final String URL = "http://www.csdn.net";
//
private static final String ECODING = "UTF-8";
// img
private static final String IMGURL_REG = "<img.*src=(.*?)[^>]*?>";
// src
private static final String IMGSRC_REG = "http:\"?(.*?)(\"|>|\\s+)";
public static void main(String[] args) throws Exception {
CatchImage cm = new CatchImage();
// html
String HTML = cm.getHTML(URL);
//
List<String> imgUrl = cm.getImageUrl(HTML);
// src
List<String> imgSrc = cm.getImageSrc(imgUrl);
//
cm.Download(imgSrc);
}
/***
* HTML
*
* @param url
* @return
* @throws Exception
*/
private String getHTML(String url) throws Exception {
URL uri = new URL(url);
URLConnection connection = uri.openConnection();
InputStream in = connection.getInputStream();
byte[] buf = new byte[1024];
int length = 0;
StringBuffer sb = new StringBuffer();
while ((length = in.read(buf, 0, buf.length)) > 0) {
sb.append(new String(buf, ECODING));
}
in.close();
return sb.toString();
}
/***
* ImageUrl
*
* @param HTML
* @return
*/
private List<String> getImageUrl(String HTML) {
Matcher matcher = Pattern.compile(IMGURL_REG).matcher(HTML);
List<String> listImgUrl = new ArrayList<String>();
while (matcher.find()) {
listImgUrl.add(matcher.group());
}
return listImgUrl;
}
/***
* ImageSrc
*
* @param listImageUrl
* @return
*/
private List<String> getImageSrc(List<String> listImageUrl) {
List<String> listImgSrc = new ArrayList<String>();
for (String image : listImageUrl) {
Matcher matcher = Pattern.compile(IMGSRC_REG).matcher(image);
while (matcher.find()) {
listImgSrc.add(matcher.group().substring(0, matcher.group().length() - 1));
}
}
return listImgSrc;
}
/***
*
*
* @param listImgSrc
*/
private void Download(List<String> listImgSrc) {
try {
for (String url : listImgSrc) {
String imageName = url.substring(url.lastIndexOf("/") + 1, url.length());
URL uri = new URL(url);
InputStream in = uri.openStream();
FileOutputStream fo = new FileOutputStream(new File(imageName));
byte[] buf = new byte[1024];
int length = 0;
System.out.println(" :" + url);
while ((length = in.read(buf, 0, buf.length)) != -1) {
fo.write(buf, 0, length);
}
in.close();
fo.close();
System.out.println(imageName + " ");
}
} catch (Exception e) {
System.out.println(" ");
}
}
}