Python для раздела «Data Eng»
48 репозиториев на Python в разделе «Data Eng».
Почему векторные базы данных не спасут агентов от аудиторов и как это решает Semantica
Разбираем Python-библиотеку Semantica, которая превращает действия AI-агентов в связный граф контекста с полной цепочкой причинно-следственных связей...
Как превратить хаос из PDF и сканов в структурированные данные с помощью Unstract
Обзор Unstract — мощной Open Source платформы для автоматизации извлечения данных из неструктурированных документов (PDF, сканы, логи) с помощью LLM.
Data-Juicer — Ваш швейцарский нож для подготовки данных под foundation models
Data-Juicer — мощный инструмент для обработки данных под задачи обучения foundation models (включая мультимедийные). Узнайте, как этот проект от Aliba...
MinerU — Ваш универсальный инструмент для работы с PDF
MinerU — мощный инструмент для преобразования PDF в структурированные форматы Markdown и JSON с сохранением макета, таблиц и формул. Узнайте, как он у...
Как перестать писать SQL руками и начать жить с Datus
Datus — это open-source агент для дата-инжиниринга, который строит семантический контекст вокруг ваших данных, позволяя создавать умных чат-ботов для...
Graphiti - Память для AI-агентов, которая не забывает прошлое
Устали от RAG, который теряет контекст в динамичных данных? Обзор Graphiti — фреймворка для создания 'живых' графов знаний, которые помнят всё и меняю...
Как подружить Claude и Cursor с Databricks при помощи AI Dev Kit
Обзор Databricks AI Dev Kit — мощного набора инструментов, который превращает Claude, Cursor и других AI-ассистентов в экспертов по разработке на плат...
Kreuzberg — швейцарский нож для работы с документами в Python
Kreuzberg — универсальный Python-фреймворк для извлечения текста и метаданных из документов любых форматов. Разбираем, чем он лучше аналогов и как упр...
Как Netflix приручил хаос в машинном обучении с помощью Metaflow
Обзор Metaflow — фреймворка от Netflix для разработки и развертывания AI/ML-систем. Узнайте, как масштабировать вычисления и переносить модели в прода...
River Когда классическое машинное обучение уже не справляется
River — мощная библиотека Python для онлайн-машинного обучения, которая позволяет моделям обучаться на потоковых данных в реальном времени. Узнайте, п...
Crawlee — ваш надежный помощник в мире веб-скрапинга на Python
Crawlee — современная Python-библиотека для веб-скрапинга и автоматизации браузера, которая делает процесс сбора данных простым и надежным. Узнайте, к...
Docling Универсальный парсер документов для эпохи искусственного интеллекта
Docling — мощный инструмент для обработки документов, который превращает PDF, DOCX и другие форматы в структурированные данные для AI-приложений. Узна...
Cognee Когда AI-агенты перестают забывать!
Устали от того, что ваши AI-агенты забывают контекст? Cognee — это open-source решение, которое превращает данные в динамическую и постоянную память д...
TrustGraph Как научить AI думать, а не галлюцинировать
TrustGraph — это open-source платформа для создания надежных AI-приложений, которые рассуждают, а не галлюцинируют. Она превращает разрозненные данные...
dbt-core — Когда данные становятся кодом
Как превратить SQL-запросы в надежную систему трансформации данных? Рассказываем о dbt — инструменте, который привносит лучшие практики разработки в м...
Как превратить базу данных в собеседника обзор OpenChatBI
Обзор OpenChatBI — мощного Open Source инструмента для общения с базами данных на естественном языке. Узнайте, как LangGraph и LLM превращают SQL-запр...
Crawl4AI — Веб-краулер для эпохи ИИ, который стоит попробовать
Crawl4AI — это открытый веб-краулер для работы с большими языковыми моделями, который превращает веб-страницы в удобные для ИИ структурированные данны...
Как перестать переписывать парсеры и начать жить с feapder
Обзор feapder — мощного Python-фреймворка для парсинга данных, который объединяет в себе простоту легких скриптов и возможности масштабируемых систем...
Mwmbl - Поисковик, который не хочет ваших денег
Mwmbl — это некоммерческая поисковая система с открытым исходным кодом, где ранжированием результатов занимается сообщество. Узнайте, как она бросает...
DocETL: Ваш проводник в мире обработки документов с LLM
DocETL — это инструмент для создания и выполнения конвейеров обработки данных, особенно подходящий для сложных задач с документами, использующий мощь...
Как перестать гадать на данных и начать доверять своим пайплайнам
Обзор GX Core (Great Expectations) — мощного инструмента для тестирования, документирования и профилирования данных на Python. Узнайте, как автоматизи...
Docling - Универсальный парсер документов для AI-разработчиков
Docling — мощный инструмент для обработки документов перед использованием в AI-моделях, поддерживающий PDF, DOCX, таблицы и даже аудиофайлы