Wayback Machine Downloader: машина времени для веб-разработчика
Репозиторий давно не обновлялся
Последнее обновление было 2 года назад.
Представьте ситуацию: вам срочно нужна старая версия сайта, но он давно изменился или вообще исчез. Или, может, вы хотите проанализировать, как развивался ресурс за годы. Вручную копировать сотни страниц через веб-архив — муторно. К счастью, есть инструмент, который делает всю работу за вас.
Что это за проект?
Wayback Machine Downloader — это Ruby-утилита, которая умеет скачивать целые сайты из архива Wayback Machine. В отличие от ручного копирования, она:
- Загружает не только HTML, но и все связанные ресурсы (CSS, JS, изображения)
- Сохраняет оригинальную структуру директорий
- Автоматически создает index.html для корректного отображения
- Позволяет выбирать конкретные версии по датам
Кому это нужно?
- Архивистам и историкам интернета — для сохранения цифрового наследия
- Веб-разработчикам — чтобы восстановить потерянные версии сайтов
- Исследователям — для анализа эволюции веб-ресурсов
- Юристам — чтобы зафиксировать контент на определенную дату
Топ-5 возможностей, которые вас удивят
1. Скачивание по временным меткам
Не нужно рыться в архиве — укажите диапазон дат в формате YYYYMMDDHHMMSS, и утилита сама найдет нужные версии:
wayback_machine_downloader http://example.com --from 20150101 --to 20161231
2. Фильтрация по типу контента
Хотите только PDF-документы или изображения? Пожалуйста:
wayback_machine_downloader http://example.com --only "/\.(pdf|jpg)$/i"
3. Параллельная загрузка
Ускоряем процесс в 20 раз (по умолчанию скачивание последовательное):
wayback_machine_downloader http://example.com --concurrency 20
4. Работа через Docker
Не хотите устанавливать Ruby? Есть контейнер:
docker run --rm -it -v $PWD/websites:/websites hartator/wayback-machine-downloader http://example.com
5. JSON-экспорт
Можно получить список всех доступных версий без скачивания:
wayback_machine_downloader http://example.com --list
Как это работает под капотом?
- Утилита запрашивает индекс snapshots с archive.org
- Фильтрует результаты по вашим критериям
- Скачивает оригинальные файлы (не перезаписанные Wayback Machine)
- Воссоздает структуру директорий
- Генерирует index.html для корректного отображения
Когда это реально пригодится?
- Восстановление сайта после критического сбоя
- Миграция контента со старого ресурса
- Юридические доказательства — архивная версия имеет точную дату
- Академические исследования эволюции веб-дизайна
- Сохранение памяти о закрывшихся популярных сайтах
Вывод: стоит ли попробовать?
Wayback Machine Downloader — незаменимый инструмент для:
- Веб-разработчиков, работающих с legacy-контентом
- Архивных команд крупных организаций
- Журналистов и исследователей цифровой культуры
Проект активно поддерживается (последнее обновление — февраль 2024), имеет 5.6k звезд на GitHub и работает стабильно. Если вам когда-либо приходилось рыться в веб-архивах — эта утилита сэкономит вам дни работы.
Совет: Начните с малого — попробуйте скачать одну страницу с опцией --exact-url, чтобы оценить возможности инструмента.
