各位前輩好,最近因為一點需求在撰寫爬蟲程式。先是參照了一些網路資源試作了一些常見網站(如高鐵)的爬蟲,雖然也碰上不少問題但都還算順利解決。
近期在整理某些領域的國內論文,因此花了不少時間在「臺灣博碩士論文知識加值系統」裡頭,想說能不能用爬蟲的方式,蒐集論文的基本資料再來篩選,但碰上了一個問題。
在用以前的經驗來撰寫爬蟲程式時,總會碰上重新導向的語法:「<META HTTP-EQUIV="Refresh" CONTENT="0; ……」,查了一些資料後發現requests.__部分有allow_redirects的參數可以使用,但就算設置其為False也沒辦法讀到東西。應該說,貌似讀到的東西也就只有那段重新導向的語法(或者是我程式上有大問題)。
後續也Google了相關的資料,但還是沒能解決這個問題,只好來此向各位詢問,希望能獲得一些指引或解答。