Wayback Machine Downloader: машина времени для веб-разработчика

08 Feb, 2024

Репозиторий давно не обновлялся

Последнее обновление было 2 года назад.

5,901
🔱 803
👥 126

Представьте ситуацию: вам срочно нужна старая версия сайта, но он давно изменился или вообще исчез. Или, может, вы хотите проанализировать, как развивался ресурс за годы. Вручную копировать сотни страниц через веб-архив — муторно. К счастью, есть инструмент, который делает всю работу за вас.

Что это за проект?

Wayback Machine Downloader — это Ruby-утилита, которая умеет скачивать целые сайты из архива Wayback Machine. В отличие от ручного копирования, она:

  • Загружает не только HTML, но и все связанные ресурсы (CSS, JS, изображения)
  • Сохраняет оригинальную структуру директорий
  • Автоматически создает index.html для корректного отображения
  • Позволяет выбирать конкретные версии по датам

Badge

Кому это нужно?

  1. Архивистам и историкам интернета — для сохранения цифрового наследия
  2. Веб-разработчикам — чтобы восстановить потерянные версии сайтов
  3. Исследователям — для анализа эволюции веб-ресурсов
  4. Юристам — чтобы зафиксировать контент на определенную дату

Топ-5 возможностей, которые вас удивят

1. Скачивание по временным меткам

Не нужно рыться в архиве — укажите диапазон дат в формате YYYYMMDDHHMMSS, и утилита сама найдет нужные версии:

wayback_machine_downloader http://example.com --from 20150101 --to 20161231

2. Фильтрация по типу контента

Хотите только PDF-документы или изображения? Пожалуйста:

Реклама
wayback_machine_downloader http://example.com --only "/\.(pdf|jpg)$/i"

3. Параллельная загрузка

Ускоряем процесс в 20 раз (по умолчанию скачивание последовательное):

wayback_machine_downloader http://example.com --concurrency 20

4. Работа через Docker

Не хотите устанавливать Ruby? Есть контейнер:

docker run --rm -it -v $PWD/websites:/websites hartator/wayback-machine-downloader http://example.com

5. JSON-экспорт

Можно получить список всех доступных версий без скачивания:

wayback_machine_downloader http://example.com --list

Как это работает под капотом?

  1. Утилита запрашивает индекс snapshots с archive.org
  2. Фильтрует результаты по вашим критериям
  3. Скачивает оригинальные файлы (не перезаписанные Wayback Machine)
  4. Воссоздает структуру директорий
  5. Генерирует index.html для корректного отображения

Когда это реально пригодится?

  • Восстановление сайта после критического сбоя
  • Миграция контента со старого ресурса
  • Юридические доказательства — архивная версия имеет точную дату
  • Академические исследования эволюции веб-дизайна
  • Сохранение памяти о закрывшихся популярных сайтах

Вывод: стоит ли попробовать?

Wayback Machine Downloader — незаменимый инструмент для:

  • Веб-разработчиков, работающих с legacy-контентом
  • Архивных команд крупных организаций
  • Журналистов и исследователей цифровой культуры

Проект активно поддерживается (последнее обновление — февраль 2024), имеет 5.6k звезд на GitHub и работает стабильно. Если вам когда-либо приходилось рыться в веб-архивах — эта утилита сэкономит вам дни работы.

Совет: Начните с малого — попробуйте скачать одну страницу с опцией --exact-url, чтобы оценить возможности инструмента.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.