Jeux de données GitHub
Les jeux de données GitHub constituent une source dynamique de données qui alimente l’innovation, permettant aux entreprises et aux chercheurs d’extraire des informations précieuses
- Des centaines de milliers d’enregistrements disponibles
- Exploitez tous les principaux points de données sur Github
- Exemples de données Github à télécharger gratuitement
Approuvé par 20,000+ clients dans le monde
Available datasets
Access fresh validated GitHub datasets. Ensure hassle-free data access by using ready-made scrapers.
- Demo data in JSON/CSV
- Fresh records
- Customize, enrich, and format the data
LinkedIn people profiles
Amazon products
LinkedIn company information
Instagram - Profiles
Crunchbase companies information
Linkedin job listings information
Zillow properties listing information
Instagram - Posts
LinkedIn posts
X (formerly Twitter) - Posts
TikTok - Profiles
Google Maps full information
Facebook - Pages Posts by Profile URL
TikTok - Posts
Youtube - Videos posts
Shopee - products
Amazon Reviews
Indeed job listings information
Walmart - products
Companies information enriched dataset
Employees business enriched dataset
TikTok Shop
YouTube - Profiles
IMDB media
Glassdoor companies overview information
Airbnb Properties Information
X (formerly Twitter) - Profiles
Google News
Yahoo Finance business information
Google maps reviews
Reddit- Posts
Instagram - Reels
Booking Hotel Listings
Shein- Products
Yelp businesses overview
Facebook - Comments
Instagram - Comments
LinkedIn profiles Jobs Listings
Glassdoor companies reviews
Zoominfo companies information
pitchbook companies information
Glassdoor job listings information
Otodom Poland
Amazon sellers info
eBay
Google Shopping
Amazon products global dataset
Github repository
Amazon best seller products
Australia real estate properties
Facebook - Posts by group URL
Home Depot US
Google Play Store
TikTok - Comments
Facebook Marketplace
Facebook - Posts by post URL
Trustpilot business reviews
Etsy
G2 software - product reviews
Amazon products search
Booking Listings Search
Goodreads books
Yelp businesses reviews
Amazon Walmart
Reddit - Comments
Zara - Products
Zillow price history
World population
Indeed companies info
Zoopla properties listing information
Target
Lazada - Products
Wikipedia articles
Pinterest - Posts
Youtube - Comments
NBA players' stats
Best Buy products
Ikea - Products
Walmart sellers info
Facebook Events
Sephora products
Realtor international properties listings
OLX Brazil - marketplace ads
Ozon.ru products
BBC news
Lowes.com
Google Play Store reviews
Facebook - Reels by profile URL
Myntra products
Xing social network
Facebook Company Reviews
Owler companies information
Creative Commons Images
H&M - Products
Google Shopping products search US
Webmotors Brasil - Cars Listings
US lawyers directory
Slintel 6sense company information
Naver products
Tokopedia Products
Apple App Store reviews
Digikey - Products
CNN news
Wayfair products
Mouser - Products
Wildberries.ru products
Manta businesses
Agoda Properties Listings
Facebook - Profiles
Zonaprop Argentina - Properties Listing
Quora posts
Carsales Cars Listings search page information
Pinterest - Profiles
Chileautos Chile - Cars Listings
VentureRadar company information
Zalando products
Inmuebles24 Mexico - Properties Listings
carsales.com.au - Cars Listings
Yapo Chile - marketplace ads
Asos - Products
Lazada - Reviews
Bluesky - Posts
Hermes- Products
Lego - Products
Trustradius product reviews
Vimeo - Videos posts
World zipcodes
Facebook - Pages and Profiles
Metrocuadrado - Properties Listings
Lazada products search (GMV)
Home Depot CA
Chanel Products
Toctoc - Properties Listings
Dior - Products
Top 500 Bluesky Profiles
Apple App Store
Creative Commons 3D Models
AE.com - Complete Products
Ashleyfurniture - Products
Properati Argentina and Colombia - Properties Listings
Infocasas Uruguay - Properties Listings
Mango Products
Balenciaga.com - Products
Crawl API
Mediamarkt.de products
Fanatics.com - Products
Toysrus - Products
Twitch - streams dataset
Carters.com - Products
Zara Home Products
Loewe.com - Products
mercadolivre.com.br products
ChatGPT Search
Rona.ca products
Prada.com - Products
Crateandbarrel - Products
Delvaux - Products
Ysl.com - Products
Fendi Products
Massimo Dutti - Products
Bottegaveneta.com - Products
Mattressfirm - Products
llbean.com - Products
Sleepnumber.com - Products
Raymourflanigan.com - Products
Mybobs.com - Products
Celine.com - Products
La-z-boy.com - Products
Berluti.com - Products
Montblanc - Products
Walmart - products zipcodes
Moynat.com - Products
Google SERP - 100 Results
Kroger.com
Threads - Posts
Zillow Full Properties Information
Google AI Mode Search
Agoda Listings Search
Threads - Profiles
LinkedIn people search
Grok Search
Zillow properties search page
Perplexity Search
Walmart products search
Bing Copilot Search
Gemini Search
Snapchat posts
Goodreads reviews
TikTok - Posts by URL Fast API
Snapchat profile
Agoda Properties Listings with Pricing
TikTok - Posts by Search URL Fast API
TikTok - Posts by Profile Fast API
Coupang products
TikTok Shop Category Products
Booking Hotel Listings with Pricing
Google Hotel
Reddit - Profiles
Échantillon de l’ensemble de données GitHub
L’ensemble de données du dépôt GitHub fournit des informations essentielles sur le monde du logiciel libre. Avec des informations complètes sur les langages de codage, la taille des dépôts et les contributions des utilisateurs, cet ensemble de données permet aux utilisateurs de se plonger dans les subtilités du développement logiciel.
Datasets Pricing
- Propre et validé
- Mise à jour mensuelle
- JSON/CSV/Parquet
Des agents d'intelligence artificielle instantanément performants
Nos ensembles de données Github sont optimisés pour l'IA/LLM : clairement structurés, bien documentés, avec du code et des recettes pour une intégration facile du LLM/chatbot. recettes pour une intégration facile de LLM/chatbot.
Structuré et propre
Des données prétraitées avec des schémas cohérents, parfaites pour la formation et l'inférence de modèles d'IA.
Exemples de codes
Des snippets Python, Node.js, cURL, PHP, Go, Java et Ruby prêts à l'emploi pour une intégration aisée dans les flux de travail de l'IA.
Documentation
curl --request GET
--url https://api.brightdata.com/datasets/snapshots/{id}/download
--header 'Authorization : Bearer '
import requêtes
url = "https://api.brightdata.com/datasets/snapshots/{id}/download"
headers = {"Authorization" : "Bearer "}
response = requests.get(url, headers=headers)
print(response.json())
const url = 'https://api.brightdata.com/datasets/snapshots/{id}/download' ;
const options = {method : 'GET', headers : {Authorization : 'Bearer '}, body : undefined} ;
try {
const response = await fetch(url, options) ;
const data = await response.json() ;
console.log(data) ;
} catch (error) {
console.error(error) ;
}
HttpResponse response = Unirest.get("https://api.brightdata.com/datasets/snapshots/{id}/download")
.header("Authorization", "Bearer ")
.asString() ;
nécessite 'uri'
requiert 'net/http'
url = URI("https://api.brightdata.com/datasets/snapshots/{id}/download")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Bearer '
response = http.request(request)
puts response.read_body
Jeux de données GitHub adaptés à vos besoins
Abonnement aux données
Abonnez-vous pour accéder aux ensembles de données à un coût considérablement réduit.
Formats de fichiers
JSON, NDJSON, JSON Lines, CSV, Parquet. Compression .gz optionnelle.
Livraison flexible
Snowflake, Amazon S3 bucket, Google Cloud, Azure y SFTP.
Des données évolutives
Évoluez sans vous soucier de l'infrastructure, des serveurs proxy ou du blocage.
Réduction des coûts
Personnalisez n'importe quel ensemble de données à l'aide de filtres et d'options de formatage.
Maintenance du code
Les ensembles de données sont mis à jour en fonction des modifications apportées à la structure du site web.
Intégrations simplifiées
Bénéficiez d'intégrations avec Snowflake et AWS.
Assistance 24/7
Une équipe spécialisée de professionnels des données est là pour vous aider.
Leaders en matière de conformité
Les données proviennent de sources éthiques et sont conformes à toutes les lois sur la protection de la vie privée.
Obtenez des données GitHub structurées et fiables
Nous fournissons les données et vous vous occupez du reste
Gros volume de données Web
Grâce à nos capacités de déblocage et à la rotation permanente des adresses IP, nous garantissons l’accès à tous les points de données d’un site Web.
Données immédiatement exploitables
Chaque aspect du processus de collecte des données est soumis à un processus rigoureux de validation des données.
Flux de données automatisé
Planifiez la livraison automatique des données et voyez comment elles seront facilement acheminées vers votre espace de stockage.
Comment les entreprises utilisent le jeu de données GitHub
Activité des développeurs
Implication de la communauté
Améliorer l’engagement
FAQ sur les jeux de données GitHub
Quelles sont les données incluses dans l’ensemble de données GitHub ?
L’ensemble de données GitHub comprend différents points de données qui répondent à vos besoins. Voici quelques-uns de ces points de données : URL, ID, code, langage de programmation, nombre de lignes, nom d’utilisateur, URL d’utilisateur, taille, unité de taille, nombre de taille, nombre de projets, nombre de forks, nombre d’étoiles, et bien plus encore.
Puis-je obtenir des mises à jour pour l’ensemble de données GitHub que j’ai acheté ?
Oui, vous pouvez obtenir des mises à jour de votre ensemble de données GitHub chaque jour, chaque semaine, chaque mois, ou bien sur une période personnalisée.
Puis-je acheter un sous-ensemble de l’ensemble de données GitHub ?
Oui, vous pouvez acheter un sous-ensemble GitHub qui n’inclura que les points de données dont vous avez besoin. L’achat d’un sous-ensemble permet de réduire considérablement les coûts.
Dans quel format vais-je recevoir le jeu de données GitHub ?
Les formats des jeux de données sont JSON, NDJSON, JSON Lines, CSV ou Parquet. En option, les fichiers peuvent être compressés au format .gz.
Puis-je scraper moi-même les données publiques de GitHub ?
Si vous ne souhaitez pas acheter un jeu de données, vous pouvez commencer à scraper les données de GitHub en utilisant notre API GitHub Scraper.
Puis-je obtenir un échantillon de données ?
Oui, vous pouvez demander un échantillon de données pour évaluer la qualité et la pertinence des informations fournies. C’est un excellent moyen de s’assurer qu’elles répondent à vos besoins avant de vous engager dans un ensemble complet de données.
Puis-je demander des points de données spécifiques de l’ensemble de données GitHub ?
Oui, vous pouvez demander des points de données spécifiques de l’ensemble de données GitHub en fonction de vos besoins particuliers, ce qui vous permet de recevoir précisément les informations dont vous avez besoin pour vos projets.
Est-il possible d’intégrer l’ensemble de données GitHub directement dans mes systèmes existants ?
Absolument, notre API transparente permet d’intégrer sans effort notre ensemble de données GitHub dans votre CRM, vos outils d’analyse ou tout autre système que vous utilisez, rationalisant ainsi vos opérations.