Kimi K3 + Graph Engineering: зниження витрат на токени на 85% та підвищення точності на 18%

@noisyb0y1
АНГЛІЙСЬКА1 день тому · 22 лип. 2026 р.
100K
160
20
12
330

Коротко

Вичерпний посібник зі створення архітектур ШІ з використанням Kimi K3 та Graph Engineering, що забезпечує зниження витрат на токени на 85% та підвищення точності на 18% порівняно з традиційним RAG.

Більшість людей використовує ШІ як дорогу пошукову систему. Відкривають чат, ставлять запитання, отримують відповідь, закривають вкладку. Наступного дня починають з нуля, бо ШІ нічого не пам'ятає.

Але є розробники, які заробляють $10,000-20,000 на місяць просто тому, що їхня ШІ-система відповідає вдвічі швидше, дає точніші відповіді та коштує на 85% менше, ніж у конкурентів. Вони не використовують якусь секретну модель. Вони побудували правильну архітектуру навколо звичайної моделі.

Це називається Kimi K3 + Graph Engineering. Microsoft витратив роки, доводячи, що це працює — зниження витрат на 85%, підвищення точності на 18%.

Ось як побудувати це самостійно з нуля за тиждень.

Чому звичайний RAG перестає працювати в певний момент

Більшість розробників будують ШІ-системи однаково. Користувач щось запитує, система шукає в документах, знаходить схожі фрагменти тексту, модель генерує відповідь. Для простих запитань це працює добре. Для складних — повністю розвалюється.

Запитайте "чому впали наші продажі в березні?" і звичайний RAG знайде документи зі словами "продажі" та "березень". Він знаходить фрагменти. Він не знаходить ланцюжок причин.

text
1Відповідь звичайного RAG:
2Ось 5 документів, які згадують продажі в березні.
3
4Відповідь Graph Engineering:
5Продажі впали через затримку релізу,
6спричинену проблемою постачальника,
7яка виникла через збій на складі,
8що викликало негативні відгуки,
9які зменшили конверсію на 23%.

Та сама модель. Ті самі дані. Абсолютно різний результат — тому що одна система шукає текст, а інша шукає зв'язки між реальними фактами.

Це те, що Microsoft, Stanford та Anthropic незалежно один від одного з'ясували. І саме тому розробники, які це розуміють, рухаються швидше за інших.

Що таке граф знань насправді

Граф знань зберігає інформацію у вигляді трійок:

text
1Суб'єкт → Відношення → Об'єкт

Реальні приклади:

text
1Kimi K3 → розроблений → Moonshot AI
2Kimi K3 → контекстне вікно → 1 мільйон токенів
3Microsoft → створили → GraphRAG
4GraphRAG → зменшує витрати → 85%
5Anthropic → створили → Claude
6Claude → підтримує → MCP

Кожен фрагмент інформації — це явний зв'язок між двома сутностями. Не абзац тексту, який може десь містити цю інформацію, а структурований факт, до якого можна звернутися безпосередньо.

text
1Звичайна база даних:
2Таблиця компаній
3Таблиця продуктів
4Немає явних зв'язків між ними
5
6Граф знань:
7Компанія → створила → Продукт
8Продукт → конкурує з → Інший Продукт
9Інший Продукт → належить → Іншій Компанії
10Компанія → інвестувала в → Іншу Компанію

Граф не просто зберігає факти. Він зберігає те, як факти пов'язані між собою. Саме це робить можливим складне міркування — і те, що звичайний RAG ніколи не зможе зробити, незалежно від того, наскільки хороша модель.

Стенфордська лабораторія ШІ визначає граф знань як структуровану базу даних, де інформація представлена у вигляді мережі сутностей і зв'язків у трійках суб'єкт-відношення-об'єкт. Використовується в пошуку, рекомендаціях та завданнях, де потрібно знаходити непрямі зв'язки.

ai.stanford.edu/blog/introduction-to-knowledge-graphs

Noisy - inline image

Чому Kimi K3 є правильною моделлю для цієї архітектури

Більшість моделей мають контекстні вікна на 128,000-200,000 токенів. Kimi K3 має один мільйон. Це не просто вражаюче число — це архітектурна перевага, спеціально для Graph Engineering.

Граф повертає підграфи, ланцюжки доказів, списки пов'язаних сутностей. Все це займає місце в контекстному вікні. З малим контекстом доводиться обрізати граф. З одним мільйоном токенів вся релевантна частина графа вміщується в одну сесію.

text
1Архітектура Kimi K3:
22.8 трильйона загальних параметрів
3896 експертів у MoE, 16 активних на токен
4Контекстне вікно на 1,048,576 токенів
5Вбудований аналіз зображень
6Kimi Delta Attention для довгих послідовностей
7Attention Residuals для збереження сигналів між шарами

kimi.com/blog/kimi-k3

Noisy - inline image

Kimi Delta Attention — це гібридний механізм, який зменшує вартість роботи з довгими послідовностями. Для Graph Engineering це означає, що система може передавати моделі великі підграфи, довгі списки доказів, десятки документів і структуру репозиторію без катастрофічного зростання витрат.

Але навіть один мільйон токенів — це тимчасова пам'ять. Після сесії все зникає.

text
1Контекст на 1M токенів = велика робоча поверхня на сесію
2Граф знань = постійна структурована пам'ять між сесіями

Kimi K3 дає масштаб і міркування. Graph Engineering дає пам'ять і структуру. Разом вони вирішують різні проблеми одночасно.

Документ 1 — Microsoft GraphRAG

github.com/microsoft/graphrag

arxiv.org/abs/2603.22528

Noisy - inline image

Microsoft створили GraphRAG і відкрили його вихідний код. Цифри з їхнього дослідження є найбільш конкретним доказом того, що насправді дає Graph Engineering у порівнянні зі звичайним RAG.

Архітектура перетворює неструктурований текст у повноцінний граф знань:

text
1Завантаження документів
2
3Розбиття документів на фрагменти
4
5Виділення сутностей і зв'язків
6
7Побудова графа
8
9Виявлення спільнот
10
11Генерація звітів по спільнотах
12
13Векторизація сутностей і звітів
14
15Локальний пошук / Глобальний пошук

Ключове відкриття Microsoft: звичайний RAG добре відповідає на локальні запитання — знайти інформацію про цю конкретну сутність. Він не справляється з глобальними запитаннями — які основні закономірності в цих 10,000 документах, що пов'язує ці події в усьому наборі даних.

Graph Engineering відповідає на обидва типи запитань.

text
1Локальний пошук | що сталося з постачальником X у березні
2 | знаходить конкретний вузол і його зв'язки
3
4Глобальний пошук | які основні моделі ризику
5 | у всіх наших відносинах з постачальниками
6 | знаходить закономірності по всьому графу

Реальні цифри з дослідження ChatP&ID:

text
1Підвищення точності | на 18% вище, ніж підхід з необробленими документами
2Зниження витрат на токени | на 85% нижче, ніж пряме завантаження структурованих файлів
3Вартість за завдання | приблизно $0.004 у протестованій конфігурації

Документ 2 — Три режими поєднання LLM і Графа знань

arxiv.org/abs/2306.08302

Одна з найсильніших теоретичних робіт про поєднання мовних моделей і графів знань описує три режими:

text
1Режим 1 — Граф покращує LLM
2Граф надає моделі факти та структуру
3Модель генерує кращі відповіді
4
5Режим 2 — LLM покращує Граф
6Модель створює, очищає та розширює граф
7Граф з часом стає кращим
8
9Режим 3 — Синергія LLM + Граф
10Граф і модель взаємно покращують один одного
11Найпотужніший режим

Для Kimi K3 + Graph Engineering найкраще працює третій режим. Kimi K3 виділяє нові факти та додає їх до графа. Граф надає Kimi K3 структурований контекст для міркування. Цикл повторюється, і система стає кращою з кожною ітерацією.

Документ 3 — Реляційна пам'ять для мовних моделей

direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00476

MIT Press, Transactions of the Association for Computational Linguistics.

Дослідження показує, що відбувається, коли ви під'єднуєте мовну модель до реляційної пам'яті — графа знань зі зв'язками замість фрагментів тексту.

text
1Текстовий контекст
2
3Виділення релевантних зв'язків з графа
4
5Реляційна пам'ять
6
7Мовна модель
8
9Більш зв'язне та точне генерування

Ключовий висновок: моделі з доступом до явних структур зв'язків створюють більш зв'язний текст і роблять менше логічних помилок, ніж моделі, які працюють лише з текстом.

Це наукове пояснення того, чому працює Graph Engineering. Моделі не потрібно виводити зв'язки з тексту. Зв'язки явно вказані в графі. Модель використовує їх безпосередньо.

Опубліковано за ліцензією CC BY 4.0 — можна вільно використовувати із зазначенням авторства.

Документ 4 — Закони масштабування для Graph Engineering

arxiv.org/abs/2505.16276

Дослідження, яке порівняло 26 моделей з відкритим кодом на завданнях графового інжинірингу знань. Висновок — один із найважливіших результатів у цій галузі:

text
1Більша модель + поганий граф | гірші результати
2Менша модель + хороший граф | кращі результати

Правильний граф перемагає більшу модель. Щоразу.

Того самого висновку дійшли Microsoft із GraphRAG та Anthropic із Claude Code — система навколо моделі визначає результат більше, ніж сама модель. Graph Engineering — це найконкретніша реалізація цього принципу.

Документ 5 — Агент-як-Граф

arxiv.org/abs/2511.18194

Ця стаття показує, як представити не лише знання, а й агентів та інструменти у вигляді вузлів у графі.

text
1Питання користувача
2
3Граф можливостей
4
5Вибір дослідницького агента
6
7Вибір інструменту GitHub
8
9Вибір інструменту ArXiv
10
11Вибір інструменту графової бази даних
12
13Kimi K3 координує виконання

Автори повідомляють про покращення Recall@5 на 14.9% та nDCG@5 на 14.6% порівняно з порівнянними системами пошуку на LiveMCPBenchmark.

Для Kimi K3 це означає, що граф може керувати не лише знаннями, а й тим, якого агента та який інструмент використовувати для кожного конкретного завдання.

Документ 6 — Kimi Code та Agent SDK

github.com/MoonshotAI/kimi-code

github.com/MoonshotAI/kimi-agent-sdk

Kimi Code — це термінальний агент, який може:

text
1Читати та редагувати код
2Виконувати команди оболонки
3Шукати файли
4Завантажувати веб-сторінки
5Аналізувати результат кожного кроку
6Самостійно обирати наступну дію
7Підтримує MCP
8Гачки життєвого циклу
9Режими підтвердження

Kimi Agent SDK дозволяє використовувати Kimi Code як основу для власного агента. Він повторно використовує інструменти, навички та конфігурацію MCP-сервера з Kimi Code.

Для Graph Engineering це готовий рівень виконання. Граф надає структуровані знання та шляхи міркування. Kimi Code виконує дії в реальному середовищі. SDK пов'язує все разом.

Повна архітектура системи

text
1Крок 1 — Рівень завантаження
2PDF, веб-сайти, бази даних, API, Slack, Notion
3
4
5Крок 2 — Рівень виділення
6Kimi K3 виділяє сутності та зв'язки
7
8{
9 "entity": "Kimi K3",
10 "type": "AI model",
11 "relations": [
12 {
13 "predicate": "developed_by",
14 "object": "Moonshot AI",
15 "confidence": 0.98
16 }
17 ]
18}
19
20
21
22Крок 3 — Рівень розпізнавання
23Система визначає, чи це одна й та сама сутність:
24Moonshot AI / Moonshot / Beijing Moonshot / 月之暗面
25
26
27
28Крок 4 — Зберігання графа
29Neo4j / Memgraph / Amazon Neptune / PostgreSQL
30
31
32
33Крок 5 — Рівень пошуку
34Векторний пошук + Пошук сутностей + Пошук шляхів
35Пошук по спільнотах + Часовий фільтр
36
37
38
39Крок 6 — Рівень агента
40Kimi K3:
41Планує підхід
42Обирає правильний інструмент
43Генерує запити Cypher або SPARQL
44Аналізує підграф
45Проводить веб-дослідження
46Робить висновки
47Визначає наступну прогалину в знаннях
48
49
50
51Крок 7 — Рівень верифікації
52Перевіряє повноту доказів
53Знаходить суперечності
54Оцінює впевненість
55Перевіряє джерела
56
57
58
59Крок 8 — Оновлення графа
60Нові факти додаються до графа
61Суперечності позначаються
62Стара інформація отримує мітку часу

Це замкнутий цикл знань і дій. Kimi K3 не просто читає граф. Він визначає, чого не вистачає, формує підпитання, вибирає вузол або підграф, виконує пошук, перевіряє результат, додає новий факт і переоцінює гіпотезу.

П'ять промптів, які керують усім конвеєром

Graph Engineering не замінює промпти. Він використовує їх на кожному конкретному етапі.

Промпт 1 — Виділення

text
1Виділи всі організації, людей, продукти та події.
2
3Для кожної сутності поверни:
4- canonical_name
5- type
6- description
7- source
8
9Для кожного зв'язку поверни:
10- source_entity
11- relation_type
12- target_entity
13- evidence
14- confidence_score

Промпт 2 — Нормалізація

text
1Порівняй наступні сутності.
2Визнач, чи вони стосуються:
3- однієї й тієї самої сутності
4- пов'язаних, але різних сутностей
5- не пов'язаних сутностей
6
7Поверни канонічну назву та пояснення.
8Не об'єднуй сутності без чітких доказів.

Промпт 3 — Запит до графа

text
1Переклади питання користувача на запит Cypher.
2Використовуй лише зв'язки, присутні в схемі.
3Не вигадуй мітки або властивості.
4Поверни запит і пояснення логіки.

Промпт 4 — Обґрунтована відповідь

text
1Відповідай, використовуючи лише знайдені шляхи графа.
2Для кожного висновку:
3- визнач підтримувальні вузли
4- визнач шлях зв'язку
5- чітко вкажи невизначеність
6- не роби висновок про причинність із кореляції

Промпт 5 — Підтримка графа

text
1Порівняй нові факти з існуючим графом.
2Класифікуй кожен факт як:
3- новий
4- дублікат
5- суперечність
6- оновлення
7- невизначений
8
9Не перезаписуй існуючі факти без доказів.

П'ять бізнесів, які можна побудувати на цій системі

1 — Інвестиційні дослідження

text
1Компанія
2├── засновники та їхні попередні проєкти
3├── інвестори та їхній портфель
4├── конкуренти та їхні стратегії
5├── юридичні ризики
6├── патенти
7├── вакансії як сигнал стратегії
8└── фінансові показники з часом

Kimi K3 читає звіти та новини. Граф показує приховані зв'язки між компаніями, спільних інвесторів, залежності постачальників та кадрові сигнали. Клієнти: інвестиційні фонди, юридичні фірми, консультанти з M&A. $2,000-10,000 на клієнта на місяць.

2 — Інженерний інтелект

text
1Коміти GitHub + задачі Jira + завдання Linear
2
3Граф інженерної роботи
4
5У 5 разів швидше виявлення інцидентів
6На 50% менше часу на наради
7Автоматичні релізні нотатки

anthropic.com/customers/graph

LaunchNotes вже продає це. Ринок — кожна інженерна команда, яка використовує більше одного інструменту управління проєктами.

3 — Науково-дослідницький двигун

text
1Стаття → автор → установа → метод → набір даних → результат
2
3Які методи GraphRAG використовують виявлення спільнот,
4на яких наборах даних їх тестували
5і які статті суперечать одна одній

Звичайний пошук дає список документів. Графова система будує карту доказів і суперечностей.

4 — Граф кіберзагроз

text
1IP → домен → сертифікат → шкідливе ПЗ → кампанія → зловмисник
2
3Kimi K3 аналізує звіти про загрози
4Картує індикатори з різних джерел
5Пояснює шляхи атак
6Автоматично оновлює граф загроз

5 — Персональна ОС знань

text
1Люди ↔ Зустрічі ↔ Проєкти ↔ Документи ↔ Рішення ↔ Обіцянки
2
3Питання, на які може відповісти Kimi K3:
4Хто блокує це завдання?
5Яке рішення ми прийняли і на чому воно базувалося?
6Що я обіцяв зробити цього місяця?
7Які старі припущення вже недійсні?

З чого почати цього тижня

text
1День 1 | встанови Neo4j локально
2 | прочитай README до DSPy
3 | github.com/stanfordnlp/dspy
4 | зрозумій різницю між промптами
5 | та програмуванням системи
6
7День 2 | візьми один набір документів
8 | запусти Kimi K3 через API
9 | виділи перші сутності та зв'язки
10 | збережи в Neo4j
11
12День 3 | побудуй перший рівень пошуку
13 | поєднай векторний пошук і пошук по графу
14 | протестуй на складному питанні, на яке RAG не може відповісти
15
16День 4 | підключи Kimi Code через MCP
17 | github.com/MoonshotAI/kimi-code
18 | дозволь агенту читати граф і додавати нові факти
19 | запусти перший цикл знань і дій
20
21День 5 | виміряй результат
22 | порівняй точність зі звичайним RAG
23 | порівняй вартість токенів
24 | знайди перший реальний кейс для клієнта

Що Microsoft, Stanford та Anthropic з'ясували разом

text
1Microsoft GraphRAG | граф знижує витрати на 85%, підвищує точність на 18%
2Stanford DSPy | модель — це вузол у графі, а не центр
3Stanford Scaling Laws | менша модель + хороший граф перемагає більшу модель
4MIT Press Research | явні зв'язки покращують зв'язність і точність
5Anthropic LaunchNotes | у 5 разів швидше виявлення інцидентів, на 50% менше часу на наради

Kimi K3 — це двигун. Graph Engineering — це карта, пам'ять і система координат. Без двигуна граф не діє. Без графа двигун рухається дуже швидко, але не завжди знає, куди йде.

Більшість розробників продовжуватимуть будувати звичайний RAG і дивуватимуться, чому на складні запитання приходять погані відповіді. Дехто витратить тиждень на побудову графової системи і ніколи не повернеться до пошуку тексту.

Ти будуєш власне життя — тому обирай правильний шлях.

/ Якщо було корисно — підпишись /

Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей