Data Engineer
ETL/ELT пайплайны, Apache Spark, Airflow, базы данных (SQL/NoSQL), потоковая обработка данных, дата-озера. Инструменты для инженерии данных.
Daft Мощный инструмент для работы с данными любого типа
Daft — это высокопроизводительный движок для обработки данных на Python и SQL, который особенно хорош для работы с мультимодальными данными и облачным...
Как превратить хаос из PDF и сканов в структурированные данные с помощью Unstract
Обзор Unstract — мощной Open Source платформы для автоматизации извлечения данных из неструктурированных документов (PDF, сканы, логи) с помощью LLM.
AutoMQ — Kafka без дисков, которая экономит миллионы и масштабируется за секунды
Устали от непомерных счетов за Kafka в облаке и сложностей с масштабированием? AutoMQ предлагает революционное решение: Kafka на S3, которая сокращает...
Debezium — Когда ваша база данных начинает говорить в реальном времени
Debezium – это open-source платформа для Change Data Capture, которая позволяет в реальном времени отслеживать и стримить изменения данных из ваших ба...
Volcano Когда Kubernetes "закипает" от AI/ML и Big Data
Устали от того, как Kubernetes справляется с требовательными пакетными задачами? Volcano — это мощный планировщик, созданный специально для AI/ML, Big...
Как заставить PostgreSQL завершать фоновые задачи даже после перезагрузки
Обзор расширения pg_durable от Microsoft: превращаем PostgreSQL в надежный движок для выполнения длительных фоновых задач с контрольными точками и защ...
data.table - турбонаддув для ваших данных в R
data.table — мощный инструмент для работы с данными в R, который ускоряет обработку таблиц в десятки раз. Узнайте, как этот пакет стал стандартом для...
AKHQ Когда Kafka становится понятной и управляемой
AKHQ – это мощный и удобный графический интерфейс для Apache Kafka, который упрощает управление топиками, данными, группами потребителей и Kafka Conne...
Data-Juicer — Ваш швейцарский нож для подготовки данных под foundation models
Data-Juicer — мощный инструмент для обработки данных под задачи обучения foundation models (включая мультимедийные). Узнайте, как этот проект от Aliba...
Apache Fesod: Когда Excel не хочет дружить с памятью
Apache Fesod: высокопроизводительная и экономичная Java-библиотека для работы с табличными файлами, которая решает проблему OutOfMemoryError при обраб...
ИИ-агенты выходят в реалтайм с Apache Flink Agents
Обзор нового фреймворка Apache Flink Agents для создания распределенных ИИ-агентов, работающих с потоковыми данными в реальном времени.
SQL для всего: Как Apache Calcite превращает любые данные в базу данных
Устали от зоопарка баз данных и разных языков запросов? Apache Calcite — это мощный фреймворк, который позволяет говорить на SQL с любыми источниками...
Как DAOS выжимает максимум из NVMe и памяти SCM
Разбираем DAOS — распределённое объектное хранилище от Linux Foundation, созданное с нуля для работы с энергонезависимой памятью и высокими нагрузками...
MinerU — Ваш универсальный инструмент для работы с PDF
MinerU — мощный инструмент для преобразования PDF в структурированные форматы Markdown и JSON с сохранением макета, таблиц и формул. Узнайте, как он у...
Pdfplumber: хирургическая точность работы с PDF в Python
Как легко извлекать текст и таблицы из PDF с помощью pdfplumber – Python-библиотеки с детальным анализом структуры документов
Как перестать писать SQL руками и начать жить с Datus
Datus — это open-source агент для дата-инжиниринга, который строит семантический контекст вокруг ваших данных, позволяя создавать умных чат-ботов для...
Как подружить Laravel и MongoDB без боли в суставах
Обзор официальной интеграции MongoDB в Laravel. Узнайте, как использовать мощь NoSQL, сохраняя привычный синтаксис Eloquent и удобство разработки.
Graphiti - Память для AI-агентов, которая не забывает прошлое
Устали от RAG, который теряет контекст в динамичных данных? Обзор Graphiti — фреймворка для создания 'живых' графов знаний, которые помнят всё и меняю...
Apache Beam — Пишите код для данных один раз, запускайте где угодно
Apache Beam: единая модель для пакетной и потоковой обработки данных. Пишите код один раз на Java, Python или Go, а запускайте на Spark, Flink или Goo...
RisingWave - Потоковая обработка данных без головной боли
RisingWave — современная платформа для обработки потоковых данных с поддержкой SQL и Python. Узнайте, как она упрощает работу с реальным временем.
Spice.ai - Ваш новый швейцарский нож для данных и ИИ-приложений
Spice.ai — это движок для SQL-запросов, поиска и LLM-инференса на Rust, который позволяет создавать быстрые, надёжные и управляемые данными приложения...
SlateDB — Ваша база данных в облаке без головной боли
SlateDB — облачная embedded база данных на Rust с хранением в object storage (S3, GCS). Идеально для приложений с бесконечным объемом данных.