
Common Crawl
United States"การทำให้การเข้าถึงข้อมูลเว็บเป็นประชาธิปไตย"
เกี่ยวกับ
Common Crawl เป็นองค์กรไม่แสวงหาผลกำไร 501(c)(3) ที่ดูแลคลังข้อมูลเว็บครอว์ที่เปิดกว้าง นับตั้งแต่ก่อตั้งในปี 2008 โดยนักวิทยาศาสตร์คอมพิวเตอร์ Gil Elbaz องค์กรได้ทำการรวบรวมข้อมูลอินเทอร์เน็ตอย่างเป็นระบบ และทำให้ข้อมูลดิบ HTML, เมตาดาต้า และข้อความที่ดึงออกมาจำนวนเพตาไบต์พร้อมใช้งานฟรี ข้อมูลถูกโฮสต์บน Amazon Web Services public S3 buckets ผู้ใช้จ่ายเฉพาะค่าใช้จ่ายในการประมวลผลและพื้นที่จัดเก็บของตนเอง คลังข้อมูลของ Common Crawl เป็นชุดข้อมูลเว็บที่เปิดให้เข้าถึงได้มากที่สุด ซึ่งใช้โดยนักวิจัย นักข่าว สตาร์ทอัพ และห้องปฏิบัติการ AI ชั้นนำ ในช่วงทศวรรษ 2020 ได้กลายเป็นแหล่งข้อมูลหลักสำหรับการฝึกโมเดลภาษาขนาดใหญ่ รวมถึง GPT-3, GPT-4 และ LLaMA การตรวจสอบในเดือนพฤศจิกายน 2025 โดย The Markup และ Wired ได้ตรวจสอบว่าบริษัท AI ใช้ข้อมูลอย่างไร ซึ่งจุดประกายการอภิปรายเกี่ยวกับการยินยอมและลิขสิทธิ์
พันธกิจ
ภารกิจของ Common Crawl คือการทำให้การเข้าถึงข้อมูลเว็บเป็นประชาธิปไตย โดยการรวบรวมข้อมูลอินเทอร์เน็ตและจัดหาเนื้อหาที่ได้มาให้ทุกคนฟรี เป้าหมายคือการลดอุปสรรคในการวิเคราะห์ข้อมูลระดับเว็บ ส่งเสริมนวัตกรรม และรักษาบันทึกประวัติศาสตร์ของเว็บที่เปิดกว้าง
ประวัติ
Gil Elbaz เริ่มสร้างครอว์เลอร์ตัวแรกในปี 2007 โดยมีแรงบันดาลใจจากความเชื่อที่ว่าข้อมูลเว็บแบบเปิดเป็นสิ่งจำเป็นสำหรับอินเทอร์เน็ตที่มีสุขภาพดี ชุดข้อมูลครอว์สาธารณะชุดแรก ซึ่งมีประมาณ 2 พันล้านหน้า ถูกเผยแพร่ในปี 2008 โครงสร้างพื้นฐานในช่วงแรกอาศัยเซิร์ฟเวอร์ที่ได้รับบริจาคและการสนับสนุน ในปี 2012 Common Crawl ได้ร่วมมือกับ Amazon Web Services เพื่อโฮสต์ข้อมูลใน S3 buckets สาธารณะ ทำให้การเข้าถึงฟรีและขยายขนาดได้ ชุดข้อมูล News Crawl เปิดตัวในปี 2015 โดยให้ฟีดบทความข่าวที่อัปเดตอย่างต่อเนื่อง ในปี 2017 คลังข้อมูลได้เติบโตเป็น 3.5 พันล้านหน้า ซึ่งเป็นชุดข้อมูลเว็บที่เปิดให้เข้าถึงได้มากที่สุดในขณะนั้น การบูมของ AI ในช่วงต้นทศวรรษ 2020 ได้เพิ่มความต้องการอย่างมาก Common Crawl กลายเป็นคลังข้อมูลการฝึกสำหรับโมเดลภาษาขนาดใหญ่โดยพฤตินัย เพื่อตอบสนองต่อข้อกังวลด้านลิขสิทธิ์และการยินยอมที่เกิดจากการตรวจสอบในปี 2025 องค์กรได้ประกาศแผนการพัฒนาระบบการยกเลิกการเข้าร่วมและการติดตามแหล่งที่มาที่ดีขึ้น
บุคคลสำคัญ
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
ผู้อำนวยการบริหาร · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
เหตุการณ์สำคัญ
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
แผนก
ข้อมูลองค์กร
- ก่อตั้ง
- +2008
- สำนักงานใหญ่
- San Francisco, California, United States
- ประเทศ
- United States
- Executive Director
- Rich Skrenta
- ประเภท
- Non-profit
- ประเภท
- Non-profit
- ก่อตั้ง
- +2008
- ประเทศ
- สหรัฐอเมริกา
- ผู้ก่อตั้ง
- Gil Elbaz
- Annual Budget
- $1–2 million
- พนักงาน
- 5–10
- Data Size
- Petabytes
ข้อมูลการเงิน
- รายได้
- $0.0 billion
- งบประมาณ
- $1–2 million
- พนักงาน
- 5–10
เว็บไซต์ทางการ
commoncrawl.org/
เข้าร่วมชุมชน
แฟนกำลังพูดคุย