Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "การทำให้การเข้าถึงข้อมูลเว็บเป็นประชาธิปไตย"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta
    ชุมชน

    เกี่ยวกับ

    Common Crawl เป็นองค์กรไม่แสวงหาผลกำไร 501(c)(3) ที่ดูแลคลังข้อมูลเว็บครอว์ที่เปิดกว้าง นับตั้งแต่ก่อตั้งในปี 2008 โดยนักวิทยาศาสตร์คอมพิวเตอร์ Gil Elbaz องค์กรได้ทำการรวบรวมข้อมูลอินเทอร์เน็ตอย่างเป็นระบบ และทำให้ข้อมูลดิบ HTML, เมตาดาต้า และข้อความที่ดึงออกมาจำนวนเพตาไบต์พร้อมใช้งานฟรี ข้อมูลถูกโฮสต์บน Amazon Web Services public S3 buckets ผู้ใช้จ่ายเฉพาะค่าใช้จ่ายในการประมวลผลและพื้นที่จัดเก็บของตนเอง คลังข้อมูลของ Common Crawl เป็นชุดข้อมูลเว็บที่เปิดให้เข้าถึงได้มากที่สุด ซึ่งใช้โดยนักวิจัย นักข่าว สตาร์ทอัพ และห้องปฏิบัติการ AI ชั้นนำ ในช่วงทศวรรษ 2020 ได้กลายเป็นแหล่งข้อมูลหลักสำหรับการฝึกโมเดลภาษาขนาดใหญ่ รวมถึง GPT-3, GPT-4 และ LLaMA การตรวจสอบในเดือนพฤศจิกายน 2025 โดย The Markup และ Wired ได้ตรวจสอบว่าบริษัท AI ใช้ข้อมูลอย่างไร ซึ่งจุดประกายการอภิปรายเกี่ยวกับการยินยอมและลิขสิทธิ์

    พันธกิจ

    ภารกิจของ Common Crawl คือการทำให้การเข้าถึงข้อมูลเว็บเป็นประชาธิปไตย โดยการรวบรวมข้อมูลอินเทอร์เน็ตและจัดหาเนื้อหาที่ได้มาให้ทุกคนฟรี เป้าหมายคือการลดอุปสรรคในการวิเคราะห์ข้อมูลระดับเว็บ ส่งเสริมนวัตกรรม และรักษาบันทึกประวัติศาสตร์ของเว็บที่เปิดกว้าง

    ประวัติ

    Gil Elbaz เริ่มสร้างครอว์เลอร์ตัวแรกในปี 2007 โดยมีแรงบันดาลใจจากความเชื่อที่ว่าข้อมูลเว็บแบบเปิดเป็นสิ่งจำเป็นสำหรับอินเทอร์เน็ตที่มีสุขภาพดี ชุดข้อมูลครอว์สาธารณะชุดแรก ซึ่งมีประมาณ 2 พันล้านหน้า ถูกเผยแพร่ในปี 2008 โครงสร้างพื้นฐานในช่วงแรกอาศัยเซิร์ฟเวอร์ที่ได้รับบริจาคและการสนับสนุน ในปี 2012 Common Crawl ได้ร่วมมือกับ Amazon Web Services เพื่อโฮสต์ข้อมูลใน S3 buckets สาธารณะ ทำให้การเข้าถึงฟรีและขยายขนาดได้ ชุดข้อมูล News Crawl เปิดตัวในปี 2015 โดยให้ฟีดบทความข่าวที่อัปเดตอย่างต่อเนื่อง ในปี 2017 คลังข้อมูลได้เติบโตเป็น 3.5 พันล้านหน้า ซึ่งเป็นชุดข้อมูลเว็บที่เปิดให้เข้าถึงได้มากที่สุดในขณะนั้น การบูมของ AI ในช่วงต้นทศวรรษ 2020 ได้เพิ่มความต้องการอย่างมาก Common Crawl กลายเป็นคลังข้อมูลการฝึกสำหรับโมเดลภาษาขนาดใหญ่โดยพฤตินัย เพื่อตอบสนองต่อข้อกังวลด้านลิขสิทธิ์และการยินยอมที่เกิดจากการตรวจสอบในปี 2025 องค์กรได้ประกาศแผนการพัฒนาระบบการยกเลิกการเข้าร่วมและการติดตามแหล่งที่มาที่ดีขึ้น

    บุคคลสำคัญ

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    ผู้อำนวยการบริหาร · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    เหตุการณ์สำคัญ

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    แผนก

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    ข้อมูลองค์กร

    ก่อตั้ง
    +2008
    สำนักงานใหญ่
    San Francisco, California, United States
    ประเทศ
    United States
    Executive Director
    Rich Skrenta
    ประเภท
    Non-profit
    ประเภท
    Non-profit
    ก่อตั้ง
    +2008
    ประเทศ
    สหรัฐอเมริกา
    ผู้ก่อตั้ง
    Gil Elbaz
    Annual Budget
    $1–2 million
    พนักงาน
    5–10
    Data Size
    Petabytes

    ข้อมูลการเงิน

    รายได้
    $0.0 billion
    งบประมาณ
    $1–2 million
    พนักงาน
    5–10

    เว็บไซต์ทางการ

    commoncrawl.org/

    เข้าร่วมชุมชน

    แฟนกำลังพูดคุย