Data Engineer
ETL/ELT пайплайны, Apache Spark, Airflow, базы данных (SQL/NoSQL), потоковая обработка данных, дата-озера. Инструменты для инженерии данных.
data.table - турбонаддув для ваших данных в R
data.table — мощный инструмент для работы с данными в R, который ускоряет обработку таблиц в десятки раз. Узнайте, как этот пакет стал стандартом для...
Data-Juicer — Ваш швейцарский нож для подготовки данных под foundation models
Data-Juicer — мощный инструмент для обработки данных под задачи обучения foundation models (включая мультимедийные). Узнайте, как этот проект от Aliba...
Apache Fesod: Когда Excel не хочет дружить с памятью
Apache Fesod: высокопроизводительная и экономичная Java-библиотека для работы с табличными файлами, которая решает проблему OutOfMemoryError при обраб...
ИИ-агенты выходят в реалтайм с Apache Flink Agents
Обзор нового фреймворка Apache Flink Agents для создания распределенных ИИ-агентов, работающих с потоковыми данными в реальном времени.
SQL для всего: Как Apache Calcite превращает любые данные в базу данных
Устали от зоопарка баз данных и разных языков запросов? Apache Calcite — это мощный фреймворк, который позволяет говорить на SQL с любыми источниками...
Как DAOS выжимает максимум из NVMe и памяти SCM
Разбираем DAOS — распределённое объектное хранилище от Linux Foundation, созданное с нуля для работы с энергонезависимой памятью и высокими нагрузками...
MinerU — Ваш универсальный инструмент для работы с PDF
MinerU — мощный инструмент для преобразования PDF в структурированные форматы Markdown и JSON с сохранением макета, таблиц и формул. Узнайте, как он у...
Как перестать писать SQL руками и начать жить с Datus
Datus — это open-source агент для дата-инжиниринга, который строит семантический контекст вокруг ваших данных, позволяя создавать умных чат-ботов для...
Graphiti - Память для AI-агентов, которая не забывает прошлое
Устали от RAG, который теряет контекст в динамичных данных? Обзор Graphiti — фреймворка для создания 'живых' графов знаний, которые помнят всё и меняю...
Apache Beam — Пишите код для данных один раз, запускайте где угодно
Apache Beam: единая модель для пакетной и потоковой обработки данных. Пишите код один раз на Java, Python или Go, а запускайте на Spark, Flink или Goo...
RisingWave - Потоковая обработка данных без головной боли
RisingWave — современная платформа для обработки потоковых данных с поддержкой SQL и Python. Узнайте, как она упрощает работу с реальным временем.
Spice.ai - Ваш новый швейцарский нож для данных и ИИ-приложений
Spice.ai — это движок для SQL-запросов, поиска и LLM-инференса на Rust, который позволяет создавать быстрые, надёжные и управляемые данными приложения...
SlateDB — Ваша база данных в облаке без головной боли
SlateDB — облачная embedded база данных на Rust с хранением в object storage (S3, GCS). Идеально для приложений с бесконечным объемом данных.
Как подружить Claude и Cursor с Databricks при помощи AI Dev Kit
Обзор Databricks AI Dev Kit — мощного набора инструментов, который превращает Claude, Cursor и других AI-ассистентов в экспертов по разработке на плат...
Unstructured.io - Из хаоса документов в порядок для ваших LLM
Устали от рутины превращения PDF и Word в структурированные данные для ваших LLM? Unstructured.io предлагает открытое решение, которое автоматизирует...
Забудьте про мучительные JOIN и познайте магию путешествий во времени с Datahike
Обзор Datahike — мощной распределенной базы данных с логическим языком запросов Datalog, Git-подобной историей изменений и поддержкой путешествий во в...
OpenLineage ДНК ваших данных – от источника до отчета
Представьте, что вы всегда знаете, откуда пришли ваши данные, как они трансформировались и куда отправились. OpenLineage делает эту мечту реальностью,...
ClickHouse на Kubernetes Altinity Operator приручает Big Data
Устали от ручного развертывания ClickHouse в Kubernetes? Altinity ClickHouse Operator автоматизирует управление кластерами, масштабирование и обновлен...
Kafbat UI — Визуальное управление Kafka без головной боли
Kafbat UI — удобный веб-интерфейс для управления кластерами Apache Kafka, который упрощает мониторинг и отладку данных в реальном времени
Omnigraph когда графовой базе данных привили гены Git
Обзор Omnigraph — графовой базы данных на Rust, которая внедряет рабочие процессы в стиле Git (ветки, мержи, коммиты) для управления данными AI-агенто...
Как LinkedIn и Uber справляются с петабайтами данных в реальном времени - знакомство с Apache Pinot
Обзор Apache Pinot — распределенного OLAP-хранилища для real-time аналитики на петабайтных масштабах. Узнайте, как LinkedIn и Uber обрабатывают миллио...
Kreuzberg — швейцарский нож для работы с документами в Python
Kreuzberg — универсальный Python-фреймворк для извлечения текста и метаданных из документов любых форматов. Разбираем, чем он лучше аналогов и как упр...