Усі статтіПоради з пошуку роботи

Qwen3 125B на RTX 4090: зробити з новини оффер

·8 хв читання
Людина за ноутбуком пізно вночі, на другому екрані статистика GPU. Photo: ThisIsEngineering, Pexels.
Фото: ThisIsEngineering

Кілька днів тому хтось запушив репозиторій Strata з досить безглуздим на перший погляд твердженням: запустити Qwen3 Flash Next на 125 мільярдів параметрів на одній RTX 4090 зі швидкістю 100 токенів на секунду. Не на кластері. Не на A100. На RTX 4090, яка стоїть у людей вдома. Це або брехня, або щось реально зламало межу між «споживацьким залізом» і «серйозним AI». І от тут починається цікаве: не технічна дискусія, а те, як ти можеш використати цю новину, щоб почати розмову, яка реально веде до роботи.

Чому ця новина взагалі варта уваги

Коротко про контекст. Qwen3 Flash Next від Alibaba Cloud - одна з найцікавіших відкритих моделей зараз. 125B параметрів це не маленька штука. Зазвичай такі моделі запускають на кількох A100 або H100, що коштує годину роботи як середня місячна зарплата джуна. Strata стверджує, що через агресивну квантизацію і специфічну архітектуру завантаження вона влізає в пам'ять однієї RTX 4090 (24 GB VRAM) і видає 100 T/s. Це не ідеальна якість повної bf16-моделі, але 100 T/s на локалі - це вже юзабельно для реальних задач. Якщо це підтвердиться масово, локальний AI буде зовсім іншим розговором з 2026 року.

  • 125B параметрів на одній відеокарті - це раніше була фантастика
  • 100 T/s означає реальний час відповіді, не чекати 3 хвилини на абзац
  • Відкрита вагова модель, тобто можна запустити оффлайн, без API-ключів і без логів у хмарі
  • Репозиторій свіжий, є питання щодо відтворюваності - і це теж гарна тема для розмови

Ти не мусиш розбиратися в цьому до останнього біта. Тобі потрібно розуміти достатньо, щоб сказати щось змістовне. І вміти скерувати розмову туди, де тебе почують.

Як не треба використовувати техновини у нетворкінгу

Спочатку про типову помилку, бо вона масова. Людина читає новину, копіює заголовок, пише в LinkedIn або Telegram комусь: «Бачили про Qwen3 на 4090? Що думаєте? Я шукаю роботу в AI!» Це не нетворкінг. Це спам із технічним присмаком. Людина на тому кінці або ігнорує, або відповідає з ввічливості, і потім контакт помирає. Чому? Бо ти не запропонував нічого, крім питання. Питання без контексту - це навантаження, не розмова.

  • «Бачили цю новину?» без власної думки - запрошення до ігнорування
  • Починати з «я шукаю роботу» раніше, ніж є контакт - теж мимо
  • Масова розсилка одного й того ж меседжу різним людям - вони відчувають це миттєво

Що реально працює: три формати розмови

Нетворкінг через технічну новину працює, коли ти приносиш власну точку зору, а не просто репостиш факт. Ось три конкретні формати, які можна зробити сьогодні.

Формат 1: Короткий пост з позицією

Не «Qwen3 тепер на 4090 - вражає!». А щось на зразок: «Strata каже, що 125B на одній RTX 4090 при 100 T/s вже реально. Якщо це відтворюється стабільно, це означає, що edge inference для корпоративних продуктів перестає бути проблемою бюджету. Питання вже не «чи можемо запустити», а «чи є сенс?». Цікаво, як це змінить рішення команд, що зараз будують on-prem AI.» Це пост, який запрошує до дискусії, бо ти сказав щось, з чим можна погодитись або посперечатись.

Формат 2: Персональне повідомлення з конкретним хуком

Якщо ти пишеш комусь напряму, новина - це лише відкривачка. Структура: одне речення про новину, одне речення про те, чому це релевантно для їхньої роботи, одне конкретне питання. Без прохання про роботу. Наприклад: «Бачив Strata - твердять, що 125B Qwen3 влазить в RTX 4090 з 100 T/s. Ви у [назва компанії] дивились на локальний inference для ваших ML пайплайнів? Мені цікаво, чи вирішує це взагалі проблему або лише пересуває її.» Якщо людина відповідає, розмова є. Далі вона або залишається технічною, або ти природно переходиш до того, чим займаєшся.

Формат 3: Коментар у чужому пості

Найменш зусильний формат, але часто найефективніший. Якщо хтось вже постить про локальний AI, Qwen, open weights або edge inference - твій змістовний коментар там помітять люди, яких ти взагалі не знаєш. Не «дякую, цікаво!», а конкретно: «100 T/s звучить добре, але мене більше цікавить, чи витримає квантизація при довгих контекстах. Strata поки не показала бенчмарки на 32k+.» Це коментар, який показує, що ти реально в темі. Людям цікаво хто ти.

Порада

Не намагайся бути експертом з усього в одному пості. Краще скажи «мені цікаво, чи витримає X» - це чесніше і запрошує інших поділитись досвідом. Люди охочіше відповідають на відкриті питання, ніж на декларації.

Як підготуватись за 20 хвилин перед розмовою

Припустимо, у тебе є дзвінок або зустріч завтра, і ти хочеш органічно вплести цю тему. Або просто хочеш говорити про неї впевнено. Ось мінімальна підготовка.

  1. 1Прочитай README репозиторію Strata - там є технічні деталі про метод квантизації. 5 хвилин.
  2. 2Знайди одну конкретну задачу, де 125B локально вирішує проблему, яку ти або твій проект мали раніше. Це твій особистий кут.
  3. 3Придумай одне скептичне запитання: чого ще не знають? Що могло б не спрацювати? Це показує, що ти критично мислиш, а не просто хайпуєш.
  4. 4Зв'яжи новину з компанією або роллю, до якої йдеш на розмову. Вони будують продукти з AI? Є compliance-обмеження на хмару? Локальний inference для них актуальний?
  5. 5Вирішуй, коли НЕ згадувати. Якщо компанія займається, наприклад, ERP для бухгалтерії, ця тема просто не приземлиться. Не тягни насилу.

Після підготовки можеш натренувати відповіді на типові follow-up питання прямо в AI Coach - задаєш контекст, і він імітує технічну дискусію, щоб ти не плавав у деталях під час реальної розмови.

Куди вести розмову, якщо вона пішла добре

Ок, людина відповіла, поговорили про Qwen3 і edge inference. Що далі? Тут є кілька природних переходів, і жоден з них не звучить як «а до речі, я шукаю роботу».

  • «Ви у себе взагалі дивитесь на open-weight моделі в продакшн?» - веде до розмови про їхній стек і потреби команди
  • «Я зараз якраз копаюсь у цьому в контексті [твій проект / твоя роль] - якщо цікаво, можу поділитись що знайшов» - ти пропонуєш цінність, а не просиш
  • «Цікаво поговорити з кимось із вашої команди, хто займається inference infrastructure. Є сенс познайомитись?» - прямо, але після того як є контакт

Головне правило: ти переходиш до пошуку роботи лише тоді, коли людина вже зацікавлена в тобі як в співрозмовнику, а не навпаки. Всі свої активні кандидатури і контакти, які виникають після таких розмов, зручно тримати в Job Tracker - бо через тиждень ти вже не пам'ятатимеш, кому і що говорив.

Для кого ця тема особливо актуальна

Не кожна новина підходить кожній ролі. Qwen3 на RTX 4090 - це реально гарна точка входу якщо ти ML/AI інженер або дата-сайентист, бекенд або платформний інженер, що будує AI-продукти, DevOps або інфра-інженер, що дивиться на AI workloads, технічний продакт-менеджер або архітект у компаніях з AI-фічами, а також будь-хто, хто шукає роботу в компаніях з compliance-обмеженнями на хмару де локальний AI - конкурентна перевага.

Якщо ти, наприклад, junior QA або sales-менеджер, ця новина не твоя точка входу. І це нормально. Для кожної ролі є свій поточний момент у новинах. Але якщо ти хоч трохи в AI-суміжних ролях, пропускати цю не варто.

Порада

Якщо репозиторій Strata виявиться сирим або важко відтворюваним, не ховай цього в розмові. «Я дивився, але не зміг відтворити стабільно на [конфігурація]» - це теж сильна позиція. Показує, що ти перевіряєш руками, а не просто ретвітиш заголовки.

Маленький план на сьогодні

Не треба робити все одразу. Ось мінімум, який реально займає менше години і може дати результат:

  1. 1Відкрий репозиторій Strata і прочитай README повністю. Запиши одне спостереження, яке здалося тобі нетривіальним.
  2. 2Напиши один LinkedIn або X пост до 200 слів з цим спостереженням і одним відкритим питанням. Не питай за лайки. Просто постав.
  3. 3Знайди одну людину, яка нещодавно постила про локальний AI або open-weight моделі. Напиши їй персональний меседж за структурою вище.
  4. 4Додай нові контакти і вакансії, що виникнуть, у трекер - щоб потім не шукати в 12 вкладках хто це взагалі був.

Нетворкінг через технічні новини - це не про те, щоб виглядати розумним. Це про те, щоб бути людиною, яка має думку і ділиться нею. Таких людей запам'ятовують. І їм пишуть першими, коли з'являється відкрита позиція.

Організуйте пошук роботи з Trackr

Відстежуйте відгуки, аналізуйте резюме з AI, готуйтесь до співбесід - безкоштовно.

Почати безкоштовно
Більше не губи заявки
Візуальна дошка з 14 етапами, аналіз CV, коуч для співбесід - безкоштовно.
Почати безкоштовно

Схожі статті

Усі статті →