האם לאשר את חזון המוצר החדש (slug זמני: council) — מנוע דיונים והכרעות ל-PRISM, על בסיס המנגנונים החיים מ-council-of-high-intelligence, בלי לשכפל את מטאפורת 'חברת התוכנה' של ChatDev/MetaGPT?
bdp-20260809-council-vision · סטטוס: ממתין לבן · הוכן ע"י אביב
כל שלושת המקורות מצביעים לאותו מקום: מטאפורת 'חברת AI' ננטשה על-ידי היוצרים שלה עצמם — פעמיים — אבל מנגנוני הדיון (הצבעה משוקללת-ביטחון, שובר-שוויון שננעל מראש, ביקורת אנונימית, יו״ר שלא מצביע) חיים, מתוחזקים, וסוגרים אחד-לאחד את הפער שלנו: חוקי ההחלטה של PRISM הם היום פרוזה בלי אכיפה. בונים את זה כמנגנון, ומודדים על 10 החלטות אמיתיות.
פתח את התוצאה — החזון המלא + המחקר
למה זו ההמלצה
שכבת הדיון חיה ומתוחזקת (עדכון אחרון 3.8.2026); משתי מסגרות 'חברת ה-AI' — MetaGPT קפאה (ינואר 2026) ו-ChatDev נטשה את המטאפורה בעצמה (שכתוב 2.0; ענף ה-chat-chain קפוא מספטמבר 2025). חוקי ההחלטה של PRISM הם היום פרוזה בלי אכיפה — בדיוק הפער, בדיוק המנגנון.
פירוט מלא
ארבע אופציות עמדו על השולחן (research.md §4) — הפירוט המלא באנגלית בקבצי המקור; תמצית:
A. שדרוג פרוטוקול-הדיון הפנימי של PRISM — המומלצת. כל מנגנון מגובה בציטוט מ-repo חי
ומתמפה כמעט 1:1 על הפער שלנו (research.md:62); בית-הקוד כבר קיים (decision_card.py).
קלאוס: שכבת הכרטיס = שבוע; הביקורת האנונימית = הסיכון בגודל חודש.
B. כלי דיון רב-מודלי עצמאי — קטגוריה אמיתית אך צפופה ולא-מוכחת; המתחזק של repo המקור
מודה בעצמו שאין benchmark (SKILL.md:580).
C. מנוע pipeline רב-סוכני בקונפיג — המרחב ששני הצוותים המקוריים נטשו בעצמם. לא בלי בידול.
D. אופציה A כ-skill שנמכר החוצה — כרטיס עתידי, אחרי שער המדידה.
---- English detail (source of truth for implementers) ----
Four options were on the table (research.md §4):
A. PRISM-internal deliberation-protocol upgrade — RECOMMENDED. Every mechanism has a
live-repo citation (0xNyk/council-of-high-intelligence, 3,844 stars, MIT, pushed
2026-08-03) and maps almost 1:1 onto PRISM's prose decision-law gap (research.md:62);
the implementation home already exists in code (runtime/decision_card.py = 888 lines,
tests/test_decision_card.py = 933 lines — measured from the files, not from research).
klaus: card layer = week-shape; anonymized cross-review = the month-shaped risk
(dispatch layer vs named-seat audit trail).
B. Standalone multi-LLM deliberation tool — real category (karpathy/llm-council 23.8k
stars) but crowded and industry-wide UNBENCHMARKED — the seed repo's own maintainer
admits no benchmarking yet (SKILL.md:580). dan: nobody pays without proof it beats
one strong model asking itself twice.
C. Config-driven multi-agent build-pipeline engine — the space BOTH original teams
abandoned themselves (ChatDev 2.0 rewrote away the company metaphor; MetaGPT's org
moved to OpenManus). Not without a differentiator we don't have.
D. A as an externally-shippable skill — future card, after the measurement gate.
Mechanisms stolen from the historical frameworks (research.md §3): MetaGPT _watch()
message-pool + ActionNode typed-SOP + NoMoneyException in-loop budget governor;
ChatDev config-driven phase chains + bounded review cycles with real-ground-truth exit
(run the artifact, grep stderr — not an LLM vote).
Measurement gate (ari): 10 real contested decisions through the encoded protocol,
compared against a control of packets that skipped it. Instrument (defined before the
gate is armed): a "caught error" = a defect in a recommendation that the protocol run
surfaced (dissent/cross-review/no-consensus escalation) and the prose-convention packet
on the same class of decision did not; adjudicator = tal, fresh-context, per decision.
Zero caught-errors over the 10 → it's ceremony, revisit B/D.
Evidence-base caveats that travel with this card (research.md §6): the five arXiv papers
cited by the protocol were NOT fetched or assessed; option D is an explicitly unsourced
synthesis guess; the research synthesis itself was single-seat until this packet's tal
verification round.
NOT approved by this card: naming (separate P6), brand, any spend, external shipping.
מקורות: products/council/research/research.md · products/council/research/council-of-high-intelligence.md · products/council/research/metagpt.md · products/council/research/chatdev.md · products/council/vision/vision.md · products/council/pipeline.md
דעות בשם
3 מומחים מסכימים · 1 בתנאי
rotem · מחקר
מסכימ/ה
אופציה A — היחידה שבה לכל מנגנון יש ציטוט מ-repo חי ופער PRISM קיים שהוא סוגר.
ראיה: council-of-high-intelligence פעיל (עדכון 3.8.2026, v1.0.0→1.2.0, תיקוני CHANGELOG אמיתיים); B צפופה ולא-מוכחת; C ננטשה פעמיים ע"י יוצריה, באופן בלתי-תלוי.
מה ישנה את דעתו/ה: חמשת מאמרי ה-arXiv — שטרם נקראו (unconfirmed, research.md §6) — יתבררו כלא תומכים בטענות הפרוטוקול, או שריצות end-to-end יפיקו הכרעות באיכות נמוכה.
ari · תפעול החברה
מסכימ/ה
A, בהיקף קשיח — האופציה היחידה שמשדרגת את המפעל עצמו וגם ניתנת לציינון; כל הכרעה שנויה-במחלוקת משאירה קבלת מתמטיקת-הצבעה שאפשר לבקר.
ראיה: חוק ה-Checked-by/Falsifier הוא היום פרוזה בלי אכיפה; מנגנוני הפרוטוקול מתמפים כמעט 1:1 על הפער (research.md:62); הקבלות משרתות את אמת-הלוח באופן טבעי.
מה ישנה את דעתו/ה: 10 החלטות אמיתיות דרך הפרוטוקול בלי אף שגיאה שנתפסה שהמוסכמה הישנה פספסה.
klaus · בנייה
מסכימ/ה
A היא שבוע, לא חודש, לשכבת הכרטיס — רוב הקוד קיים (runtime/decision_card.py, 888 שורות נמדדו; ולידציה fail-closed בשורות 387–423; opinions[] כבר בסכמה, שורה 41).
ראיה: העבודה החדשה = שדות סכמה + פונקציית ספירה אחת + קובץ נעילה לפני הצבעה. הסיכון בגודל חודש: ביקורת צולבת אנונימית בשכבת השיגור מול חובת הייחוס בשם.
מה ישנה את דעתו/ה: אם האנונימיזציה לא שורדת את חובת הייחוס בשם — A נשלחת בלי המנגנון הכי טוב שלה, ו-B נראית טוב יותר.
dan · אסטרטגיה
בתנאי
A — ואומר בפה מלא: אין לה הצעת ערך חיצונית היום. הקונה הוא בן; המטבע הוא אמון בהכרעות שנויות-במחלוקת; ניתן להוכחה בשבועות.
ראיה: הקטגוריה של B לא מוכחת אצל המקור עצמו — karpathy/llm-council הוא מימוש-ייחוס (23.8k כוכבים; מסחור לא נבדק — unconfirmed), ו-repo המקור לא עבר benchmark בהודאת המתחזק שלו (SKILL.md:580, מצוטט מילולית בדוח).
מה ישנה את דעתו/ה: סגמנט קונים חיצוני אחד בשמו המוכן לשלם לפני שקיים benchmark — אז B הופכת אמיתית ושווה קמפיין.
נספח
המלצה: אופציה A: לקודד את מנגנוני הדיון החיים לתוך מסלול כרטיסי-ההחלטה של PRISM; למדוד על 10 החלטות אמיתיות.
מה יפריך את זה: שער 10 ההחלטות (קבוצת ביקורת + הגדרת 'שגיאה שנתפסה' + טל כשופט — בפירוט) לא תופס אף שגיאה שהמוסכמה הישנה פספסה, או שהביקורת האנונימית לא יכולה להתקיים לצד חובת הייחוס בשם.
מי בדק: טל — שלושה סבבי אימות בהקשר נקי (9.8.2026): סבב 1 FAIL — 9 פגמים, כולם תוקנו; סבב 2 אישר 8/9 סגורים ומצא 2 חוסמים חדשים (עדות-עצמית בדף התוצאה, קבלה חסרה) — תוקנו; סבב 3 PASS (2 הערות קוסמטיות, תוקנו). הדוחות המלאים: products/council/reviews/tal-vision-card.md
כמה עולה לחזור אחורה: נמוכה עד שלב ה-Implement — מסמכים וענף סכמה אחד; שום דבר חיצוני, אפס הוצאה.