Kog хоче пришвидшити LLM-інференс на звичайних GPU

Французький стартап Kog робить ставку на софтверну оптимізацію GPU й готується показати першу велику модель із 10-кратним приростом швидкості.
Французький стартап Kog просуває ідею, яка йде наперекір поширеному уявленню про AI-обчислення: компанія хоче суттєво пришвидшити інференс великих мовних моделей на звичайних датацентрових GPU. Замість нового заліза вона робить ставку на програмну оптимізацію вже наявних графічних процесорів.
Для розробників і бізнесу це не дрібниця. Дедалі частіше вузьким місцем стають саме швидкість і вартість AI-відповідей, тож можливість отримати кращий результат без заміни інфраструктури виглядає привабливо. Але Kog ще треба довести, що її підхід працює не лише в демонстраціях, а й на великих моделях.
Kog робить ставку на швидкість без нового заліза
Kog заявила, що може забезпечити “extremely fast single-request decoding” на стандартних датацентрових GPU, які підприємства вже мають у своєму розпорядженні. Для демонстрації стартап використав AMD MI300X та Nvidia H200.
Після техпрев’ю компанія потрапила на головну сторінку Hacker News у травні. CEO Gaël Delalleau розповів TechCrunch, що це принесло не лише увагу, а й 200 “tangible business leads”.
Логіка Kog проста: якщо AI-інференс можна пришвидшити без заміни обладнання, компаніям не доведеться витрачатися на нові спеціалізовані системи. Для частини бізнесу це може означати дешевший і швидший запуск AI-інструментів на вже встановленій інфраструктурі.
Першими клієнтами Kog бачить розробників
За ранніми відгуками Kog очікує, що першим великим сценарієм використання стане software engineering. Це не дивно: користувачі Claude Code, як повідомляють Новини IT-PUB, іноді змушені чекати результатів годинами, а Anthropic уже бере вищу ціну за Claude’s Fast Mode.
Саме на таких клієнтів стартап і націлюється — тих, кого затримки дратують, бо AI став частиною професійної роботи. Для цієї аудиторії швидкість — це не просто зручність, а й економія часу та потенційно грошей.
Окремо Kog працює з design partners, які генерують ігри та застосунки за допомогою промпта. Для них швидший результат через Kog Inference Engine (KIE) може напряму впливати на виручку, каже Delalleau.
Обіцянка 30x швидшого інференсу ще треба перевірити
Попри інтерес із боку ринку, Kog визнає, що сегмент ще не зовсім дозрів. Працюючи з раннім попитом, компанія з’ясувала, що потенційні клієнти поки не готові fine-tune невеликі моделі. Тому, за словами Delalleau, після запуску стартап повністю зосередився на прискоренні розробки більших моделей.
Найбільший виклик для Kog — підтвердити обіцянку “30x faster LLM inference”. Демо справді виглядало вражаюче: 3,000 tokens per second на один запит. Але йшлося про спеціально створену невелику модель Laneformer 2B із приблизно 2 мільярдами параметрів, яку вже відкрили у відкритий доступ.
Саме тут і виникає головне питання: чи зможе підхід, який добре працює на компактній моделі, так само ефективно розігнати великі LLM, де інференс значно складніший. Kog наполягає, що зможе.
Команда спирається на фізику, кібербезпеку і низькорівневий аналіз
Delalleau каже, що скептики помиляються, коли вважають GPU не дуже придатними для decoding. На його думку, нові графічні процесори мають дедалі більшу пропускну здатність пам’яті, яку ще потрібно “розблокувати”.
При цьому Kog не єдина компанія, що вірить у програмне прискорення GPU. Інший французький стартап, ZML, випустив hardware-agnostic software, що обходить Nvidia’s CUDA і підтримує швидкий інференс на конкуруючих чипах. Але Delalleau каже, що Kog ближчий до лабораторії Stanford University Hazy Research і працює ще глибше на рівні оптимізації GPU.
Такий підхід не випадковий. Delalleau вивчав solid-state physics в École Polytechnique, а потім працював в offensive cybersecurity, тобто white hat hacking. За його словами, це навчило його дивитися на систему як на набір правил, які можна зрозуміти й використати ефективніше.
Наукова частина цього мислення, пояснює він, полягає в прагненні зрозуміти закони фізики та “закони GPU”, щоб витиснути з них максимум. А досвід у кібербезпеці дав йому навички reverse-engineering на дуже низькому рівні — аж до assembly language і binary code.
Маленька команда і довгий цикл перевірки
У такого підходу є очевидний мінус: він дуже ручний і забирає багато часу. Delalleau каже, що для кожного нового GPU команда витрачатиме “кілька тижнів або навіть місяців”, занурюючись у деталі та проводячи GPU engineering research саме на цьому обладнанні.
Зараз у Kog лише 11 людей, тому кількість чипів, з якими стартап може працювати одночасно, принаймні найближчим часом буде обмеженою. Це означає, що масштабування не буде простим навіть у разі успішних тестів.
У довшій перспективі Kog хоче перенести свою методологію в agent-based pipelines, щоб підтримувати більше чипів і моделей. Для Європи, яка прагне розвивати власні можливості в цих напрямах, це може стати додатковим аргументом на користь стартапу.
Компанію вже підтримують Scaleway, а також Bpifrance і програма French Tech 2030.
Вересень може стати для Kog вирішальним
Зараз Kog потрібно довести, що її підхід працює саме на LLM. Це важливо не лише для репутації, а й для наступного раунду фінансування.
Delalleau сказав, що якщо компанії вдасться реалізувати першу велику модель зі швидкістю у 10 разів вищою, і це станеться у вересні, Kog зможе показати перші ознаки customer traction. Після цього стартап розраховує перейти до залучення Series A.
Тепер Kog опинилася в точці, де гучної технічної обіцянки вже недостатньо. Від того, чи вдасться перенести демонстраційний результат на великі моделі, залежить, чи стане ця ідея не лише помітною заявою, а й реальним бізнес-кейсом.