# Notebooks

- Canonical URL: https://leandeep.com/notebooks/
- Author: map[name:Olivier Eeckhoutte]
- Published: 2014-04-10T00:00:00Z
- Updated: 2014-04-10T00:00:00Z
- Language: fr
- License: CC BY-NC 4.0 (https://creativecommons.org/licenses/by-nc/4.0/)


Last update of this page: May 2019



## Notebooks et tips


Here is a list of useful notebooks to handle different use cases:

1. [Gérer les gros datasets qui ne passent pas en mémoire](/datalab-own/huge-dataset.htm)
2. [Modèle complexe ou modèle simple ?](/datalab-own/modele-complexe-donnees-brutes-modele-simple-donnees-retravaillees.htm)
3. [Chemin le plus court](/datalab-own/chemin-le-plus-court.htm)
4. [Exemple d'analyse de données sur dataset déséquilibré](/datalab-own/analyse-donnees-dataset-desequilibre.htm) et [rapport d'analyse associé](/datalab-own/analyse-donnees-dataset-desequilibre_files/report.pdf) - Crédit: [Erdi Olmezogullari](https://github.com/erdiolmezogullari)
5. [Régression linéaire avec Tensorflow](/datalab-own/regression-lineaire-avec-tensorflow.html)
6. [Classification avec Tensorflow](/datalab-own/classification-avec-tensorflow.html)
7. [Underfitting and overfitting](/datalab-kaggle/underfitting-and-overfitting.html)

**Spark recommandation engine example:**

1. [Recommandation part 1](/datalab-own/Spark/building-recommender.html)
2. [Recommandation part 2](/datalab-own/Spark/online-recommendations.html)
3. [Statistics mllib](/datalab-own/Spark/mllib-statistics.html)

<br/>

## Compétitions Kaggle et kernels associés

Here is a list of notebooks I studied and find interesting coming from Kaggle and having a MIT licence. I keep them here as inspirational sources or knowledge base.

**Kaggle Winning solutions**

1. [Kaggle winning solutions](https://www.kaggle.com/sudalairajkumar/winning-solutions-of-kaggle-competitions)

2. [Kaggle winning solutions 2ème option](https://ndres.me/kaggle-past-solutions/)

3. [Kaggle winning solutions 3ème option](https://faridrashidi.github.io/kaggle-solutions/)

**Kernels sur le sujet "titanic"**

1. [Good data exploration](/datalab-kaggle/good-data-exploration.html)
2. [Framework to achieve 99% accuracy](/datalab-kaggle/a-data-science-framework-to-achieve-99-accuracy.html)
3. [End to end Machine Learning pipeline](/datalab-kaggle/titanic-survival-prediction-end-to-end-ml-pipeline.html)
4. [Exploratory data analysis and feature extraction](/datalab-kaggle/data-analysis-and-feature-extraction-with-python.html)

**Kernels sur le sujet "iris"**

* [Full analysis](/datalab-own/Iris-Machine-Learning-Notebook.html)

**Kernels autour du customer churn**

* [Full analysis](/datalab-own/churn.html)

**Kernels autour du jeu populaire battle royale**

* [Fun EDA](/datalab-kaggle/eda-is-fun.html)

**Kernels autour Google Analytics Customer Revenue Prediction**

* [Simple Exploration+Baseline](/datalab-kaggle/simple-exploration-baseline-ga-customer-revenue.html)

**Kernels autour des sales forecast**

* [Sales Forecast ecommerce](/datalab-kaggle/e-commerce-sales-forecast.html)

**Kernels sur le sujet "Porto Seguro’s Safe Driver Prediction"**

* [Data preparation & exploration](/datalab-kaggle/data-preparation-exploration.html)


**Recruit Restaurant Visitor Forecasting.**

* [Top 25 solution](/datalab-kaggle/recruit-restaurant.html)


**Sujets autour du sujet "House Pricing"**

1. [Full Workflow](/datalab-kaggle/DS-Workflow-for-HP-+10-ML-Algorithms-+12-Plot.html)
2. [regularized linear models](/datalab-kaggle/regularized-linear-models.html)
3. [Stacked Regressions](/datalab-kaggle/stacked-regressions-top-4-on-leaderboard.html)

**Sujets autour de la compétition "home-credit-default-risk"**

URL: https://www.kaggle.com/c/home-credit-default-risk

To understand the data feel free to access [the "Data" chapter in this notebook](/datalab-kaggle/kb002.html#Data) of this notebook:

Read-only Kernels:
1. [Basic end-to-end training of a LightGBM model](/datalab-kaggle/kb001.html)

2. Très bonnes explications sur la métrique ROC AUC et quelle métrique utiliser pour mesurer la performance d'un modèle lorsque des classes ne sont pas équilibrées ? Traite du _One Hot Encoding_ et du problème pour les features ayant trop de catégories (réduction de dimension). Explication sur le feature engineering et en particulier la construction de nouvelles features avec les méthodes _Polynomial Features_ et _Domain Knowledge Features_. [Home Credit Default Risk Competition - Full process - Part 1](/datalab-kaggle/kb002.html)

3. On continue à améliorer le modèle de la compétition home-credit-default-risk en créant de nouvelles features. On analyse si elles ont un impact sur la performance du modèle avec le coefficient de Pearson ou la Kernel Density Exploration (KDE). [Home Credit Default Risk Competition - Full process - Part 2](/datalab-kaggle/kb003.html)

4. (WIP) On continue encore à améliorer le modèle de la compétition home-credit-default-risk en utilisant toutes les données à disposition. [Home Credit Default Risk Competition - Full process - Part 3](/datalab-kaggle/kb004.html) 


**LUNA16 competition**

* [Full preprocessing](/datalab-kaggle/luna-full-preprocessing-tutorial.html)

**NYC taxi trip duration**

* [Last cab to new york animated heatmap](/datalab-kaggle/last-cab-to-new-york-animated-heatmap-trips-folium.html)

**Kernal autour du sujet Pokemon-Weedle's Cave**

* [Full tutorial](/datalab-kaggle/pokemon-data-sciencetutorial-for-beginners.html)

**Other kernels**

1. [Comprehensive data exploration](/datalab-kaggle/comprehensive-data-exploration-with-python.html)
2. [Handling missing values](/datalab-kaggle/handling-missing-values.html)

3. Fraud detection in Insurance
- 3.1. [Part 1](/datalab-own/InsuranceClaimsFraudDetection/InsuranceClaimsFraudDetection.html)
- 3.2. with Keras [Part 2](/datalab-own/InsuranceClaimsFraudDetection/InsuranceClaimsFraudDetection_UsingKeras.html)

 
