Bigset: یک جمله بده، دیتاستِ زندهٔ وب تحویل بگیر
خلاصهٔ کاملتر
شرکتِ TinyFish ابزاری به اسم Bigset رو منتشر کرده؛ یه سیستمِ چندایجنتیِ متنباز که یه جملهٔ سادهٔ زبانی رو به یه دیتاستِ ساختیافته که از وبِ زنده استخراج شده تبدیل میکنه. کاربر توصیف میکنه چی میخواد، و Bigset اسکیما رو استنباط میکنه، ایجنتهای خودگردان میفرسته که روی صفحههای واقعیِ وب تحقیق کنن، یافتهها رو در برابرِ منابع راستیآزمایی و تکراریها رو حذف میکنه، و در نهایت یه جدولِ تمیز تحویل میده که میشه بهصورت CSV یا XLSX خروجی گرفت. میشه یه دورهٔ بهروزرسانی (از هر ۳۰ دقیقه تا هفتگی) هم تنظیم کرد تا ایجنتها طبق برنامه دوباره اجرا بشن و دیتاست بدونِ دستکاریِ اسکریپت تازه بمونه.
به گفتهٔ سازنده، کار بین دو نقشِ ایجنت تقسیم میشه. یه ایجنتِ هماهنگکننده (orchestrator) کشفِ سطحاول (breadth-first) انجام میده، یعنی تشخیص میده کدوم ردیفها به دیتاست تعلق دارن و دادهشون کجای وبه، بعد زیرایجنتها رو میفرسته تا هرکدوم رو پر کنن. خودِ هماهنگکننده هیچ دسترسیِ نوشتنی نداره.
هر زیرایجنت روی یه موجودیتِ واحد و تحتِ یه بودجهٔ سفتوسختِ ۶ فراخوانیِ ابزار تحقیق میکنه، دادهها رو از طریقِ TinyFish Search و Fetch میکشه و یک ردیفِ راستیآزماییشده بههمراهِ URL منبع و سابقهٔ نحوهٔ پیداشدنِ داده درج میکنه. زیرایجنتها صراحتاً موظفان هیچ مقداری رو جعل نکنن، فیلدی که قابلِ تأیید نیست رو خالی بذارن و کلیدِ اصلیِ تکراری رو خودکار رد کنن. هماهنگکننده تا وقتی دیتاست به تعدادِ ردیفِ هدف برسه ادامه میده و هرچی بیشتر یاد بگیره داده کجاست، سریعتر میسازه.
از نظر فنی، Bigset با لایسنسِ AGPL-3.0 و بهصورت سلفهاست روی Docker اجرا میشه. بهصورت پیشفرض استنباطِ اسکیما روی Claude Sonnet 4.6 و نقشهای ایجنت روی Qwen3.7-max اجرا میشن، همه از طریقِ OpenRouter و قابلِتنظیم برای هر نقش. تیم صادقانه میگه پروژه آزمایشیه: ساختِ هر دیتاست ۲ تا ۵ دقیقه طول میکشه، روی موضوعهایی با دادهٔ عمومیِ وب بهتر کار میکنه و سطحِ رایگانش ۲٬۵۰۰ عملیاتِ ردیف در ماه رو پوشش میده. ابزار با ۹ دیتاستِ آمادهٔ عمومی (مثل قیمتِ GPU، قیمتگذاریِ مدلها و محبوبترین مخزنهای متنباز) عرضه شده.
به گفتهٔ نویسنده، TinyFish یه شرکتِ مستقر در پالو آلتوئه که با ۴۷ میلیون دلار سرمایهٔ سری A پشتیبانی میشه و Google، DoorDash و Amazon از مشتریهای سازمانیشن. Bigset مستقیم روی همون زیرساختِ وبِ TinyFish ساخته شده و بهعنوان پاسخِ متنباز به ابزارهای انحصاریِ ساختِ دیتاست از زبانِ طبیعی معرفی میشه؛ بدونِ قیمتگذاریِ هر-کاربر و بدونِ محدودیتِ دامنه.
نکات کلیدی:
- تبدیلِ یه جملهٔ سادهٔ زبانی به دیتاستِ ساختیافته از وبِ زنده، با خروجیِ CSV/XLSX
- معماریِ دو نقشی: یه هماهنگکننده برای کشف، و زیرایجنتها برای پرکردنِ هر ردیف زیرِ بودجهٔ ۶ فراخوانی
- زیرایجنتها داده جعل نمیکنن، فیلدِ نامطمئن رو خالی میذارن و تکراریها رو رد میکنن
- متنباز با لایسنسِ AGPL-3.0، سلفهاست روی Docker؛ Claude Sonnet 4.6 برای اسکیما و Qwen3.7-max برای ایجنتها
- پروژهٔ آزمایشی؛ ساختِ هر دیتاست ۲ تا ۵ دقیقه و سطحِ رایگان ۲٬۵۰۰ عملیاتِ ردیف در ماه




