Насколько wget может справиться с задачей зеркалирования сайтов, но со следующими условиями.
1. необходимо ходить по ссылкам сайта: http://site/folder (т.е. не выходит из папки, только по уровням вверх)
2. сохранять только .html/.htm (остальное не сохранять)
3. возможность прерывания этого процесса и продолжения через некоторое время
Не знаю какие там флаги могут отвечать за сохранение только .html файлов.. Не подскажите ли?
Ну и ещё желательно список УРЛов по которым ходить разрешено (по _всем_ остальным нельзя).
Кто-нибудь занимался сохранением копий сайтов через wget?
man
man wget
-k --convert-links After the download is complete, convert the links in the document to make them suitable for local viewing. This affects not only the visible hyperlinks, but any part of the document that links to external content, such as embedded images, links to style sheets, hyperlinks to non-HTML content, etc. --page-requisites Recursive Accept/Reject Options -A acclist --accept acclist -R rejlist --reject rejlist Specify comma-separated lists of file name suffixes or patterns to accept or reject (@pxref{Types of Files} for more details).и ещё вагон и маленькая тележка про куки, время, прокси, ДНС и ещё чёрт зает что.
ну что - трудно на ман глянуть?
Лучше info wget.
Лучше info wget. Целая книжка однако. С примерами опять жеж.
если не осилите
если не осилите вгет, то есть замечательная тулза httrack к ней вебморда прилагается :D
:)
а что за морда?
а что за морда? как называется?
вместе с ним и
вместе с ним и идёт
был в портеджах khttrack, но его выкинули некоторое время назад.
:)
webhttrack морда
webhttrack
морда называется. Как уже сказали, идёт в комплекте с httrack.
Да я-то как
Да я-то как раз-таки httack не осилил (-:
так и не смог решить эту проблему с правилами:
http://gentoo.ru/node/7235
почему подумал и о wget..
Кое чего
Кое чего начинает вырисовываться...
т.о. сливаю только docs*.html файлы из всех директорий.
Почему сливается файл "robots.txt"? Под какие правила он подпадает?
Почему-то закачиваются ещё пустые папки (они не подпадают под правило!). Они действительно есть на сайте. Но нафига их качать?
(там они не пустые, у меня пустые)
как такое можно реализовать?
Хм.. а поведение
Хм.. а поведение в целом интересное..
Командую:
А почему же он его вообще сохраняет, если адрес у меня в отрицательных правилах??
Что-то совсем не в курю в управление вгэтом.. Ман читаю, не помогает (-:
Реально ли указать ему чтобы он НЕ ХОДИЛ по определённым ссылкам, не то что даже сохранял..?? Вроде указал ему как надо, а такое впечатление что указал я ему "только по этим и ходи" (-: Он всё равно продолжает уверенно топать по ним..
Народ, скажите
Народ, скажите пожалуйста, а можно ли WGet заставить ходить только по ссылкам удовлетворяющим правилам?? Он ходит по всем абсолютно, сохраняет, а потом удаляет тут же - типа под правило не подошло.
Как ему поставить так, чтобы он ходил только по ссылкам где присутствует подстрока "str"?
Внимательное прочтение man wget ...
Внимательное прочтение man wget обогатит твой опыт в нужном объёме.
Опции -A -R действительно скачивают и удаляют файлы. Тебе надо воспользоваться опцией -L типа wget site.com -Lsite.com, странички будут скачиваться только с данного сайта. Продолжение скачивания -с рааботает только в случае с большими файлами. С html её применять почти бесполезно.
"ходить по
"ходить по указанным сайтам" я уже прочёл. Вопрос был о хождении по указанным урлам, а не сайтам.
По сайту-то он одному ходит, а вот урлы.. Я хочу ему задать правила УРЛов, по которым ему нужно ходить (по остальным не нужно).
Или -L и этим занимается?