Crawl4AI
เครื่องมือที่ดูดข้อมูลจากเว็บมาแปลงเป็นเนื้อความสะอาด ๆ พร้อมส่งให้ AI อ่านต่อ
open_in_newดูบน GitHubterminalคำสั่งที่ใช้ได้
crwl https://example.com -o markdownเปิดหน้าเว็บแล้วแปลงเป็นเนื้อความสะอาดในรูปแบบ markdowncrwl https://example.com -q "ดึงราคาสินค้าทั้งหมด"ให้ AI อ่านหน้าเว็บแล้วดึงเฉพาะข้อมูลที่คุณสั่งcrwl https://example.com --deep-crawl bfs --max-pages 10ตามลิงก์ในเว็บไปเก็บหลายหน้าต่อกัน โดยจำกัดจำนวนหน้าpip install -U crawl4aiติดตั้งตัวเครื่องมือลงเครื่องcrawl4ai-setupตั้งค่าครั้งแรก ติดตั้งเบราว์เซอร์เบื้องหลังที่ใช้เปิดเว็บให้อัตโนมัติcrawl4ai-doctorตรวจว่าติดตั้งครบและพร้อมใช้งานหรือยัง
มันคืออะไร
Crawl4AI คือเครื่องมือที่เอาไว้ดูดเนื้อหาจากหน้าเว็บ แล้วแปลงให้กลายเป็นข้อความสะอาด ๆ ที่ AI อ่านง่าย เวลาคุณเปิดเว็บปกติ มันจะมีทั้งเมนู โฆษณา ปุ่มกด ป๊อปอัป ปนกับเนื้อหาจริงเต็มไปหมด Crawl4AI ทำหน้าที่กรองส่วนที่ไม่จำเป็นออก เหลือไว้แต่เนื้อความหลัก แล้วจัดให้อยู่ในรูปแบบที่เรียกว่า markdown ซึ่งเป็นข้อความล้วนที่มีหัวข้อกับย่อหน้าเป็นระเบียบ
วิธีคิดง่าย ๆ มันเหมือนคนช่วยถ่ายเอกสารให้ ที่ตัดขอบรก ๆ โฆษณา และรอยเปื้อนออก เหลือแค่ตัวเนื้อหาที่อ่านรู้เรื่อง พอได้ข้อความสะอาดแบบนี้แล้ว คุณจะเอาไปวางต่อให้ ChatGPT หรือ Claude สรุป วิเคราะห์ หรือค้นหาต่อได้ทันที โดยที่ AI ไม่ต้องไปสะดุดกับขยะบนหน้าเว็บ
แก้ปัญหาอะไรให้คุณ
ปกติถ้าคุณอยากให้ AI ช่วยอ่านข้อมูลจากเว็บ คุณต้องนั่งคัดลอกข้อความทีละหน้า ซึ่งมักจะติดเมนูกับโฆษณามาด้วย พอเว็บมีหลายหน้าก็ยิ่งเสียเวลา และบางเว็บข้อมูลไม่โผล่มาทันทีเพราะต้องเลื่อนลงหรือกดโหลดเพิ่ม การคัดลอกมือจึงได้ไม่ครบ Crawl4AI จัดการส่วนนี้ให้อัตโนมัติ มันเปิดเว็บเหมือนคนเปิดจริง รอให้เนื้อหาขึ้นครบ แล้วดึงออกมาให้เป็นข้อความที่สะอาดและพร้อมใช้ คุณจึงเอาข้อมูลจากเว็บเข้าสู่ AI ได้เร็วและครบกว่าเดิมมาก
เอาไปทำอะไรได้บ้าง
- ดูดบทความหรือหน้าเว็บยาว ๆ ออกมาเป็นข้อความสะอาด แล้วส่งให้ AI สรุปต่อ
- ตามลิงก์ในเว็บไปเก็บข้อมูลหลายหน้ารวดเดียว เช่นเก็บทั้งคู่มือออนไลน์หรือทั้งบล็อก
- สั่งให้ดึงเฉพาะข้อมูลที่ต้องการออกมา เช่นราคาสินค้า รายชื่อ หรือหัวข้อข่าว
- เก็บข้อมูลจากเว็บที่ต้องเลื่อนลงเรื่อย ๆ ถึงจะโหลดเพิ่ม ซึ่งคัดลอกมือได้ยาก
- เตรียมกองข้อมูลจากหลายเว็บไว้เป็นคลังให้ AI ของคุณค้นหาและตอบคำถามต่อ
เริ่มใช้ทีละขั้น
- คัดลอกลิงก์ GitHub ด้านล่าง
- เปิด Claude Code, Claude Cowork หรือ Codex แล้ววางลิงก์ บอกมันว่า "ช่วยติดตั้งและตั้งค่าเครื่องมือนี้ให้หน่อย" มันจะติดตั้งตัวเครื่องมือและตั้งค่าเบราว์เซอร์เบื้องหลังให้เอง
- ลองสั่งงานง่าย ๆ ก่อน เช่นบอกว่า "ช่วยดูดเนื้อหาจากลิงก์นี้มาเป็น markdown ให้หน่อย" แล้ววางลิงก์เว็บที่คุณอยากได้
- พอคล่องแล้ว ลองสั่งงานที่ซับซ้อนขึ้น เช่นให้ตามลิงก์ไปเก็บหลายหน้า หรือให้ดึงเฉพาะข้อมูลบางอย่างออกมา
ตัวอย่าง prompt
ช่วยใช้ Crawl4AI ดูดเนื้อหาจากลิงก์บทความนี้มาเป็นข้อความสะอาด แล้วสรุปประเด็นสำคัญออกมาเป็นภาษาไทยให้หน่อย https://example.com/article
ข้อควรระวัง
Crawl4AI ทำงานพื้นฐานได้โดยไม่ต้องใช้กุญแจ API ใด ๆ คือดูดเว็บมาเป็น markdown ได้เลย แต่ถ้าคุณใช้ฟังก์ชันที่ให้ AI อ่านหน้าเว็บแล้วดึงข้อมูลเฉพาะอย่าง (คำสั่งที่มี -q) ส่วนนี้ต้องต่อกับโมเดล AI สักตัวเช่น OpenAI ซึ่งมักต้องใช้กุญแจ API และมีค่าใช้จ่ายตามปริมาณที่เรียกใช้ นอกจากนี้ตอนติดตั้งครั้งแรก มันจะลงเบราว์เซอร์เบื้องหลังเพิ่มเพื่อใช้เปิดเว็บ จึงกินพื้นที่และเวลาตั้งค่าพอสมควร และควรเก็บข้อมูลเท่าที่จำเป็น เคารพเงื่อนไขการใช้งานของเว็บต้นทาง เพราะบางเว็บไม่อนุญาตให้ดูดข้อมูลอัตโนมัติ การยิงดูดถี่หรือหนักเกินไปอาจทำให้โดนบล็อกได้