Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
dTub
Скачать

Eng & Kwon - Scaling data workloads using the best of both worlds: pandas and Spark

Автор: PyData

Загружено: 2023-06-20

Просмотров: 695

Описание:

www.pydata.org

It is indisputable that pandas is oftentimes the keystone element in any data wrangling and analysis workloads. However, the challenge is that pandas is not meant for big data processing. This presents data practitioners a dilemma: should we downsample data and lose information? Or should we explore a distributed processing framework to scale out data workloads? An example of a mainstream distributed processing tool is Apache Spark. However, this means data practitioners now have to learn a new language, PySpark. Not all is bleak though: pandas API on Spark provides pandas equivalent APIs in PySpark. It allows pandas users to transition from single-node to distributed environment, by just simply swapping the pandas package with pyspark.pandas.

On the other hand, existing PySpark users may wish to write their own custom user-defined functions (UDFs) that are not included in existing PySpark API. Pandas Function APIs, newly included in Spark 3.0+, allow users to apply arbitrary Python native functions, with pandas instances as the input and output against a PySpark dataframe. For instance, data scientists could use pandas function API to train a ML model based on each group of data using a single line of code.

Co-presented by both a top open-source Apache Spark commiter and a hands-on data science consultant, this talk equips data analysts and scientists with the knowledge of scaling their data analysis workloads with implementation details and best practice guidance. Working knowledge of pandas, basic Spark, and machine learning is helpful.

PyData is an educational program of NumFOCUS, a 501(c)3 non-profit organization in the United States. PyData provides a forum for the international community of users and developers of data analysis tools to share ideas and learn from each other. The global PyData network promotes discussion of best practices, new approaches, and emerging technologies for data management, processing, analytics, and visualization. PyData communities approach data science using many languages, including (but not limited to) Python, Julia, and R.

PyData conferences aim to be accessible and community-driven, with novice to advanced level presentations. PyData tutorials and talks bring attendees the latest project features along with cutting-edge use cases.

00:00 Welcome!
00:10 Help us add time stamps or captions to this video! See the description for details.

Want to help add timestamps to our YouTube videos to help with discoverability? Find out more here: https://github.com/numfocus/YouTubeVi...

Eng & Kwon - Scaling data workloads using the best of both worlds: pandas and Spark

Поделиться в:

Доступные форматы для скачивания:

Скачать видео mp4

  • Информация по загрузке:

Скачать аудио mp3

Похожие видео

Betchel & Kiraly - a workbench for creating scikit-learn like parametric objects and libraries

Betchel & Kiraly - a workbench for creating scikit-learn like parametric objects and libraries

Holden Karau: A brief introduction to Distributed Computing with PySpark

Holden Karau: A brief introduction to Distributed Computing with PySpark

Proto-OKN Masterclass: Natural Language Querying Across Knowledge Graphs with MCP

Proto-OKN Masterclass: Natural Language Querying Across Knowledge Graphs with MCP

Изучите Apache Spark за 10 минут | Пошаговое руководство

Изучите Apache Spark за 10 минут | Пошаговое руководство

Как происходит модернизация остаточных соединений [mHC]

Как происходит модернизация остаточных соединений [mHC]

Chat With Your Database Using AI (Text-to-SQL AI Agent)

Chat With Your Database Using AI (Text-to-SQL AI Agent)

PyData Seattle 2023

PyData Seattle 2023

Компания Salesforce признала свою ошибку.

Компания Salesforce признала свою ошибку.

JetKVM - девайс для удаленного управления вашими ПК

JetKVM - девайс для удаленного управления вашими ПК

Эксклюзив от человека, который придумал AGI

Эксклюзив от человека, который придумал AGI

Зеленский пошел на бунт против Трампа, о чем говорит скандал с песней Тины Кароль. Итоги 20.01

Зеленский пошел на бунт против Трампа, о чем говорит скандал с песней Тины Кароль. Итоги 20.01

Превращение старого ноутбука в домашний сервер! (2026)

Превращение старого ноутбука в домашний сервер! (2026)

Я в опасности

Я в опасности

Где начало СХЕМЫ? Понимаем, читаем, изучаем схемы. Понятное объяснение!

Где начало СХЕМЫ? Понимаем, читаем, изучаем схемы. Понятное объяснение!

Т-90М2 «РЫВОК» - ТАНК, КОТОРЫЙ ЗАМЕНИТ «АРМАТУ» НА ФРОНТЕ!

Т-90М2 «РЫВОК» - ТАНК, КОТОРЫЙ ЗАМЕНИТ «АРМАТУ» НА ФРОНТЕ!

The Windows 11 Disaster Microsoft Didn’t See Coming

The Windows 11 Disaster Microsoft Didn’t See Coming

Превратите ЛЮБОЙ файл в знания LLM за СЕКУНДЫ

Превратите ЛЮБОЙ файл в знания LLM за СЕКУНДЫ

Deepyaman Datta-✕-Data engineering with Python the right way-  -PyData Boston 2025

Deepyaman Datta-✕-Data engineering with Python the right way- -PyData Boston 2025

Keynote Lisa Amini-What’s Next in AI for Data and Data Management--Pydata Global 2025

Keynote Lisa Amini-What’s Next in AI for Data and Data Management--Pydata Global 2025

Польша Выкапывает Тонны Грунта со Дна Балтийского Моря, Чтобы Лишить Россию Контроля над Ним

Польша Выкапывает Тонны Грунта со Дна Балтийского Моря, Чтобы Лишить Россию Контроля над Ним

© 2025 dtub. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: infodtube@gmail.com