home.social

#onnx — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #onnx, aggregated by home.social.

  1. I created this free open source dashcam app

    It turns your phone into an on device computer vision police detector, spotting patrol vehicles on the road in real time

    dashradar.app

  2. Trained a small object detection model that spots Las Vegas Metro police vehicles in real time. Runs in your browser on WebGPU and on a phone, no server. ONNX weights are up on Hugging Face.

    huggingface.co/tuxracer/las-ve

  3. В 14 раз быстрее: как мы ускорили генерацию эмбеддингов в Manticore через ONNX

    Когда мы выпустили Auto Embeddings — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдельного сервиса для работы с ML-моделью, — главный запрос пользователей касался скорости работы. Ранее для генерации эмбеддингов использовался только стек SentenceTransformers поверх Candle (Rust-рантайм Hugging Face для ML-инференса), и ресурсы CPU использовались далеко не полностью: в большинстве сценариев нагрузки показатель QPS держался на уровне нескольких десятков документов в секунду независимо от способа подачи данных, а параллельные запросы обрабатывались последовательно в рамках одной сессии модели. Поэтому мы в течение нескольких недель оптимизировали механизм запуска ONNX-моделей в Manticore. Новый бэкенд ONNX Runtime доступен начиная с Manticore Search 27.1.5 . ONNX (Open Neural Network Exchange) — переносимый формат моделей, в котором уже публикуется большинство популярных open-source моделей для эмбеддингов: MiniLM, BGE, E5 и другие. В результате получилось решение, которое в среднем в 14 раз быстрее прежней реализации SentenceTransformers/Candle на том же оборудовании (обычный недорогой сервер с 16 ядрами / 32 потоками), с той же моделью и теми же весами, если усреднить по всей матрице замеров threads × batch , — и это преимущество сохраняется как при одном клиентском потоке, так и при тридцати двух. Предыдущая реализация во всём диапазоне нагрузок показывала 5–11 документов/с; новая реализация работает в диапазоне 70–230 документов/с.

    habr.com/ru/articles/1051864/

    #onnx #onnx_runtime #onnxruntime #embeddings #эмбеддинги #инференс #векторный_поиск #vector_search

  4. В 14 раз быстрее: как мы ускорили генерацию эмбеддингов в Manticore через ONNX

    Когда мы выпустили Auto Embeddings — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдельного сервиса для работы с ML-моделью, — главный запрос пользователей касался скорости работы. Ранее для генерации эмбеддингов использовался только стек SentenceTransformers поверх Candle (Rust-рантайм Hugging Face для ML-инференса), и ресурсы CPU использовались далеко не полностью: в большинстве сценариев нагрузки показатель QPS держался на уровне нескольких десятков документов в секунду независимо от способа подачи данных, а параллельные запросы обрабатывались последовательно в рамках одной сессии модели. Поэтому мы в течение нескольких недель оптимизировали механизм запуска ONNX-моделей в Manticore. Новый бэкенд ONNX Runtime доступен начиная с Manticore Search 27.1.5 . ONNX (Open Neural Network Exchange) — переносимый формат моделей, в котором уже публикуется большинство популярных open-source моделей для эмбеддингов: MiniLM, BGE, E5 и другие. В результате получилось решение, которое в среднем в 14 раз быстрее прежней реализации SentenceTransformers/Candle на том же оборудовании (обычный недорогой сервер с 16 ядрами / 32 потоками), с той же моделью и теми же весами, если усреднить по всей матрице замеров threads × batch , — и это преимущество сохраняется как при одном клиентском потоке, так и при тридцати двух. Предыдущая реализация во всём диапазоне нагрузок показывала 5–11 документов/с; новая реализация работает в диапазоне 70–230 документов/с.

    habr.com/ru/articles/1051864/

    #onnx #onnx_runtime #onnxruntime #embeddings #эмбеддинги #инференс #векторный_поиск #vector_search

  5. В 14 раз быстрее: как мы ускорили генерацию эмбеддингов в Manticore через ONNX

    Когда мы выпустили Auto Embeddings — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдельного сервиса для работы с ML-моделью, — главный запрос пользователей касался скорости работы. Ранее для генерации эмбеддингов использовался только стек SentenceTransformers поверх Candle (Rust-рантайм Hugging Face для ML-инференса), и ресурсы CPU использовались далеко не полностью: в большинстве сценариев нагрузки показатель QPS держался на уровне нескольких десятков документов в секунду независимо от способа подачи данных, а параллельные запросы обрабатывались последовательно в рамках одной сессии модели. Поэтому мы в течение нескольких недель оптимизировали механизм запуска ONNX-моделей в Manticore. Новый бэкенд ONNX Runtime доступен начиная с Manticore Search 27.1.5 . ONNX (Open Neural Network Exchange) — переносимый формат моделей, в котором уже публикуется большинство популярных open-source моделей для эмбеддингов: MiniLM, BGE, E5 и другие. В результате получилось решение, которое в среднем в 14 раз быстрее прежней реализации SentenceTransformers/Candle на том же оборудовании (обычный недорогой сервер с 16 ядрами / 32 потоками), с той же моделью и теми же весами, если усреднить по всей матрице замеров threads × batch , — и это преимущество сохраняется как при одном клиентском потоке, так и при тридцати двух. Предыдущая реализация во всём диапазоне нагрузок показывала 5–11 документов/с; новая реализация работает в диапазоне 70–230 документов/с.

    habr.com/ru/articles/1051864/

    #onnx #onnx_runtime #onnxruntime #embeddings #эмбеддинги #инференс #векторный_поиск #vector_search

  6. Per anni l'audio su Linux ha significato scegliere tra PulseAudio e JACK, e farli litigare.

    PipeWire 1.6 ha chiuso la partita: un solo sistema, e funziona. 👇
    gomoot.com/dal-caos-pulseaudio

    #audio #Linux #midi #ONNX #opensource #Pipewire

  7. Per anni l'audio su Linux ha significato scegliere tra PulseAudio e JACK, e farli litigare.

    PipeWire 1.6 ha chiuso la partita: un solo sistema, e funziona. 👇
    gomoot.com/dal-caos-pulseaudio

    #audio #Linux #midi #ONNX #opensource #Pipewire

  8. Как я завёл нормальный голос в детское приложение, не разорившись и не заставив никого лезть в настройки

    Я в одиночку делаю детское приложение, где дети учат английский через рисование: рисуют слова, а оно распознаёт рисунок и отвечает голосом. В MVP голос был системный — бесплатный, но звучит как робот из нулевых, пока сам не зайдёшь в настройки и не докачаешь нормальный. Я сделал модалку с инструкцией. Угадайте, сколько людей ей воспользовались. Короче, примерно никто. Значит, хороший голос должен достаться всем сразу, без единого телодвижения юзера. И при этом дёшево — причём не только по деньгам. Рассказываю, как я завёл озвучку через ElevenLabs так, что в проде она почти ничего не стоит, работает офлайн и отвечает мгновенно. Ключ оказался в одном наблюдении: всё, что приложение когда-либо скажет, известно заранее. А ещё — почему, когда ты соло и кодишь в паре с агентом, главные проверки в пайплайне работают за ту команду, которой у тебя нет. Как это устроено

    habr.com/ru/articles/1047888/

    #TTS #ElevenLabs #React_Native #Expo #Cloudflare_Workers #детские_приложения #ONNX #TDD #AIразработка #Claude_Code

  9. Как я завёл нормальный голос в детское приложение, не разорившись и не заставив никого лезть в настройки

    Я в одиночку делаю детское приложение, где дети учат английский через рисование: рисуют слова, а оно распознаёт рисунок и отвечает голосом. В MVP голос был системный — бесплатный, но звучит как робот из нулевых, пока сам не зайдёшь в настройки и не докачаешь нормальный. Я сделал модалку с инструкцией. Угадайте, сколько людей ей воспользовались. Короче, примерно никто. Значит, хороший голос должен достаться всем сразу, без единого телодвижения юзера. И при этом дёшево — причём не только по деньгам. Рассказываю, как я завёл озвучку через ElevenLabs так, что в проде она почти ничего не стоит, работает офлайн и отвечает мгновенно. Ключ оказался в одном наблюдении: всё, что приложение когда-либо скажет, известно заранее. А ещё — почему, когда ты соло и кодишь в паре с агентом, главные проверки в пайплайне работают за ту команду, которой у тебя нет. Как это устроено

    habr.com/ru/articles/1047888/

    #TTS #ElevenLabs #React_Native #Expo #Cloudflare_Workers #детские_приложения #ONNX #TDD #AIразработка #Claude_Code

  10. Как я завёл нормальный голос в детское приложение, не разорившись и не заставив никого лезть в настройки

    Я в одиночку делаю детское приложение, где дети учат английский через рисование: рисуют слова, а оно распознаёт рисунок и отвечает голосом. В MVP голос был системный — бесплатный, но звучит как робот из нулевых, пока сам не зайдёшь в настройки и не докачаешь нормальный. Я сделал модалку с инструкцией. Угадайте, сколько людей ей воспользовались. Короче, примерно никто. Значит, хороший голос должен достаться всем сразу, без единого телодвижения юзера. И при этом дёшево — причём не только по деньгам. Рассказываю, как я завёл озвучку через ElevenLabs так, что в проде она почти ничего не стоит, работает офлайн и отвечает мгновенно. Ключ оказался в одном наблюдении: всё, что приложение когда-либо скажет, известно заранее. А ещё — почему, когда ты соло и кодишь в паре с агентом, главные проверки в пайплайне работают за ту команду, которой у тебя нет. Как это устроено

    habr.com/ru/articles/1047888/

    #TTS #ElevenLabs #React_Native #Expo #Cloudflare_Workers #детские_приложения #ONNX #TDD #AIразработка #Claude_Code

  11. Компиляция yolov8n в формат HEF для Hailo-8L на Raspberry Pi 5

    Подготовка модели Yolo для запуска на базе Hailo чипа для Raspberry Pi 5 AI HAT+. Если есть интерес к легким аппаратным решениям в области ИИ, то добро пожаловать. В статье я затрагиваю вопрос подготовки модели детекции к работе на компактной малинке.

    habr.com/ru/articles/1048976/

    #onnx #hailo #hailo8 #raspberry #ultralytics #yolo #yolo8 #ml #mlops #ai

  12. I'm writing a C# app with ONNX for facial detection and in part of it doing `tensor[0, 2, y, x] = r`. After running the app for a day it used almost 8 GB memory. I coudldn't really find any obvious memory leaks, but found that the indexer actually created a temporary `int[]`. I refactored the indexer to `tensor[2 * width * height + y * width + x] = r`, and did some other (unrelated changes). And now a day later it's at 0.4 GB. Is that how this works?

    To pharaphrase the Haskell saying:
    > The [garbage collector] should have protected me from this!

    #csharp #onnx #optimisation

  13. I'm writing a C# app with ONNX for facial detection and in part of it doing `tensor[0, 2, y, x] = r`. After running the app for a day it used almost 8 GB memory. I coudldn't really find any obvious memory leaks, but found that the indexer actually created a temporary `int[]`. I refactored the indexer to `tensor[2 * width * height + y * width + x] = r`, and did some other (unrelated changes). And now a day later it's at 0.4 GB. Is that how this works?

    To pharaphrase the Haskell saying:
    > The [garbage collector] should have protected me from this!

    #csharp #onnx #optimisation

  14. Трансформер в on-premise AppSec: как мы встроили ML-модель для классификации секретов в продукт без GPU

    Рассказываем, как мы интегрировали CodeBERT-based модель классификации секретов в production-продукт с жёсткими ограничениями по железу, сократив время инференса с 320 до 90 секунд и размер модели с ~600 до ~130 МБ — без дискретных ускорителей и тяжёлых зависимостей.

    habr.com/ru/companies/codescor

    #appsec #onnx #mlops #opensource #оптимизация #codescoring #ml

  15. أطلق تطبيق PhotoPrism تحديثاً جديداً ينقل ميزة التعرف على الوجوه بالكامل إلى نظام يعتمد على ONNX، مما يتيح مرونة أكبر في استخدام نماذج الذكاء الاصطناعي. كما تم إعادة تصميم شريط المعلومات الجانبي لتسهيل إدارة البيانات الوصفية، وإضافة دعم لتسريع ترميز الفيديو عبر تقنية Vulkan وقراءة صور HEIC وAVIF وملفات PSD. يتضمن التحديث أيضاً تحسينات في تصفية الملصقات، ودعم ميزة السحب والإفلات لرفع الملفات، وترجمات جديدة للواجهة بالاستعانة بأدوات الترجمة الآلية.

    #PhotoPrism #ONNX

  16. My current #DotNetMAUI and #NeuralNetworks project: Design and train NNs in #GoogleColab and transfer them to a #CrossPlatform app using #ONNX. Basic principle established. Next I have to think of a genuinely useful and (the hard part) original trained NN to go in a mobile app.

    philotalk.com/mobile-neural-ne

  17. Govorun PC: переносим офлайн-диктовку с Android на Windows за один вечер (с Claude)

    На Android у меня живёт Govorun Lite — офлайн-диктовка на русском. Нажал кнопку, сказал, текст вставился. Никаких облаков, никакой отправки голоса на серверы. Работает через GigaAM v2 от Сбера. Проблема одна: на ПК такого нет. Встроенная Windows-диктовка — онлайн. Whisper — либо медленный, либо требует видеокарту. Сторонние сервисы — снова облако. Я решил портировать Govorun на Windows, и для ускорения взял Claude как пару-программиста. Что из этого вышло — в этой статье.

    habr.com/ru/articles/1031240/

    #python #speechrecognition #onnx #windows #llm #голосовой_ввод

  18. 🍏🔪 #Apple thinks it's clever by running #ONNX in a browser, promising AI-powered Gaussian Splats—because nothing screams cutting-edge tech like mathematical blobs. 🖥️🤖 GitHub's turning into a buzzword bingo, but hey, at least the navigation menu's toggle switch works. 🎉🙄
    github.com/bring-shrubbery/ml- #AI #GaussianSplats #GitHub #BuzzwordBingo #TechNews #HackerNews #ngated

  19. 🍏🔪 #Apple thinks it's clever by running #ONNX in a browser, promising AI-powered Gaussian Splats—because nothing screams cutting-edge tech like mathematical blobs. 🖥️🤖 GitHub's turning into a buzzword bingo, but hey, at least the navigation menu's toggle switch works. 🎉🙄
    github.com/bring-shrubbery/ml- #AI #GaussianSplats #GitHub #BuzzwordBingo #TechNews #HackerNews #ngated

  20. My current #DotNetMAUI and #NeuralNetworks project: Design and train neural networks in #GoogleColab and transfer them to a cross-platform app using #ONNX. Follow my progress here:

    philotalk.com/mobile-neural-ne

  21. Приложение real-time face swap на чистом Rust: ONNX Runtime, lock-free потоки и 60 кадров в секунду

    Большинство инструментов для замены лиц это Python-скрипты, склеенные из PyTorch, OpenCV и надежды. Они работают, но тащат за собой гигабайты зависимостей, требуют правильно настроенного CUDA и разваливаются в тот момент, когда ты пытаешься запустить их в реальном времени. Мне стало интересно: можно ли собрать весь пайплайн на чистом Rust? Без Python. Без PyTorch. Без обёрток. Один бинарник, который скачал, распаковал и запустил. Оказалось, можно. 60 fps на веб-камере. Пайплайн На каждом кадре последовательно отрабатывают четыре нейросети. RetinaFace находит лица и извлекает пять ключевых точек. ArcFace вычисляет 512-мерный эмбеддинг исходного лица. InSwapper принимает регион целевого лица и эмбеддинг источника, на выходе отдаёт заменённое лицо. GFPGAN опционально улучшает результат для более высокого качества. Все четыре модели работают через ONNX Runtime. Никаких кастомных CUDA-ядер, никакого оверхеда фреймворков. Тензор на вход, тензор на выход. Архитектура потоков Три потока, ноль блокировок на горячем пути. Поток захвата получает кадры с веб-камеры через nokhwa и публикует их через ArcSwap. Поток пайплайна подхватывает новые кадры, прогоняет инференс и публикует обработанные кадры через второй ArcSwap. Поток UI читает актуальный буфер и рендерит через egui. Никаких мьютексов на данных кадра. Никаких каналов. Никакого async. Только атомарные счётчики поколений и lock-free замена указателей. Структуры разделяемого состояния занимают ровно по 64 байта каждая и выровнены по кэш-линиям, чтобы исключить false sharing между ядрами. Это проверяется compile-time ассертами.

    habr.com/ru/articles/1024700/

    #Rust #ONNX #Machine_Learning #Computer_Vision #Face_Detection #egui #Open_Source #lockfree #multithreading #realtime

  22. [Перевод] Agentis Memory — Redis-совместимое хранилище со встроенным векторным поиском и локальными эмбеддингами

    В наше время уже никого не удивишь разработкой агентов, очередной оптимизацией, новой моделью или новой инфраструктурой для нейронок. Всё это в порядке вещей. Однако одно дело читать в Twitter «мы написали агента X и он оптимизировал нам процессы на 300000%», и совсем другое — начать копать чуть глубже. Копнёшь — а «агентом» называют скилл с одним промптом. Разработка настоящих агентов — задача не тривиальная. Достаточно посмотреть на утёкшие исходники Claude CLI — это не просто CLI, а целая инфраструктура бизнес-логики вокруг LLM. Я бы сравнил разработку агентов с разработкой типичных бэкенд-компонентов. Аналогия такая: если вы пишете каноничный бэкенд-сервис — вам нужна СУБД. Если Web3-сервис — блокчейн. Но на СУБД или блокчейне происходит в лучшем случае 50% всей логики. Вся магия крутится именно на бэкенде. С агентами то же самое: подключаешь AI SDK, конфигурируешь мыслительное ядро и пишешь вокруг него всю обвязку — мониторинги, AIOps, оркестрацию, memory management. Вот про memory management и пойдёт речь.

    habr.com/ru/articles/1018784/

    #Redis #AI_agents #GraalVM #ONNX #embeddings #HNSW #Java_Vector_API #SIMD #Project_Loom #LLM

  23. Уязвимости в Spring AI и ONNX: как дыры в ИИ‑фреймворках превращаются в утечки данных и чужие модели

    ИИ‑фреймворки давно въехали в прод, но к ним часто относятся как к «научной приблуде», а не к ещё одному входу в ваши данные и инфраструктуру. Spring AI и ONNX крутятся где‑то между ML‑командами, продуктами вендоров и внутренними ассистентами, и на определённом этапе за ними перестают успевать архитектура и безопасность. В марте в обзорах уязвимостей рядом всплыли несколько критичных багов именно в этих штуках. Там есть и SQL‑инъекции, и JSONPath‑инъекции, и обход проверки доверия при загрузке моделей. В статье разбираю, что это значит для тех, кто уже тащит ИИ в прод, и даю чек‑лист, который можно прямо отнести своей команде.

    habr.com/ru/articles/1014606/

    #onnx #spring #spring_framework #spring_security #cve #vulnerability #vulnerability_management #уязвимости #уязвимости_и_их_эксплуатация #уязвимость_нулевого_дня

  24. Как я учил компьютер понимать 122 000 фотографий — и почему сложностью оказались не нейронки, а слова

    Я крайне редко на фрилансе получал заказы связанные с DS/ML, специалистов для таких задач обычно ищут не там. Причины разные: они требуют долгой интеграции, заказчик сам не понимает задачу, DS более конфиденциален, DS часто возникают внутри продукта, да и в последнее время этот сегмент на фрилансе съедается при помощи LLM: AI integration, RAG боты например. Но, внезапно, мне в личку постучались с таким проектом.

    habr.com/ru/articles/1010932/

    #computer_vision #machine_learning #clip #embeddings #классификация_изображений #zeroshot_learning #уменьшение_размерности_данных #фриланс #продуктовая_разработка #onnx

  25. inference4j: Java Inference API for Onnx models. Run AI models in Java. Three lines of code, zero setup.

    #ai #inference #java #models #onnx

    github.com/inference4j/inferen

  26. Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk

    За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.

    habr.com/ru/articles/1002260/

    #speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python

  27. Ускоряем инференс в Python с ONNX

    Привет! Если у вас когда‑либо был опыт деплоя нейросетки, вы знаете, что обучение — это полдела, а вот добиться шустрого инференса — целое искусство. Часто обученная в PyTorch модель дает замечательные метрики, но стоит попытаться запустить её в приложении начинаются всякие проблемки. Одно из решений, которое часто выручает — ONNX и ONNX Runtime. Если эти буквы для вас пока ничего не значат — не беда, сейчас разберёмся что к чему. А если вы уже слышали про ONNX, то, возможно, задавались вопросом: «А реально ли ускорить инференс, заморочившись с этой технологией?» Еще как! Ускорить инференс

    habr.com/ru/companies/otus/art

    #python #ONNX #инференс #ускорение_моделей #бенчмаркинг

  28. v1 Of DoomSummarizer is out.
    It's a crazy deep research / auto knowledgebase system. Point it at a directory of word docs, pdf and markdown it'll index it all then answer questions about the contents. Point it at a url it'll parse the content, index it and tell you what it's about.
    Crawl your company's knowledgebase? It'll automatically become a support AI.

    Want to know what your biggest invoice was, when you sent that angry letter etc...all local, all private, all open source (unlicense) . Quick two as unlike most RAG systems it MINIMIZES token use.

    #llm #ai #rag #search #localllm #ollama #onnx github.com/scottgal/lucidrag/r

  29. Инференс нейросетевых моделей для табличных данных с помощью ONNX Runtime на C++

    ONNX Runtime (ORT) — это высокопроизводительный движок для выполнения моделей в формате Open Neural Network Exchange (ONNX). Он предлагает оптимизированные реализации для CPU и GPU, поддержку различных аппаратных ускорителей и, что ключевое, простой C++ API. В этой статье мы разберем, как выполнить инференс модели для табличных данных, используя ONNX Runtime в C++ проекте. Ссылка для скачивания: Библиотеку можно получить через официальный GitHub (сборка из исходников). Для простоты в проектах часто достаточно забрать предсобранные бинарники из релизов .

    habr.com/ru/articles/991430/

    #onnxruntime #onnx #ORT #DL #TabularDL #C++ #инференс_моделей

  30. Problem: we keep using frontier LLMs as glue for jobs that are already solved.

    Solution: run OCR + NER locally in C# with ONNX Runtime. Deterministic extraction on ingest. Store the entities. Use an LLM later only if you actually need synthesis.

    OCR with Tesseract, then BERT NER via ONNX in .NET. No Python, no cloud, no tokens.

    This is my 'for beginners' article. I'm DEEP in OCR but realised I never explained the quickest way to do this *locally*.

    mostlylucid.net/blog/simple-oc

    #CSharp #DotNet #ONNX #OnnxRuntime #OCR #NER #LocalAI #RAG #DocumentAI

  31. Problem: we keep using frontier LLMs as glue for jobs that are already solved.

    Solution: run OCR + NER locally in C# with ONNX Runtime. Deterministic extraction on ingest. Store the entities. Use an LLM later only if you actually need synthesis.

    OCR with Tesseract, then BERT NER via ONNX in .NET. No Python, no cloud, no tokens.

    This is my 'for beginners' article. I'm DEEP in OCR but realised I never explained the quickest way to do this *locally*.

    mostlylucid.net/blog/simple-oc

    #CSharp #DotNet #ONNX #OnnxRuntime #OCR #NER #LocalAI #RAG #DocumentAI

  32. New in lucidRAG: AudioSummarizer, Reduced RAG + Constrained Fuzziness for audio.

    Compute once at ingestion: deterministic signals + auditable evidence (transcript, diarization turns, tiny speaker clips).
    Query-time: retrieve facts → optional LLM narrates. No accent/genre guessing. No speaker naming. Offline, pure .NET.

    mostlylucid.net/blog/audiosumm

    #RAG #dotnet #ONNX #Audio #Privacy #SignalProcessing #LLM

  33. I started working on INT8 quantization in December, but have been mentally blocked for weeks now. I have very little motivation, and the lack of documentation for any of these advanced ONNX topic isn't helping. #cpp #ONNX #Darknet #YOLO

  34. Python won the research workflow.
    But production AI is a different game.

    Java’s concurrency, native integration (Project Panama), and ONNX Runtime support make it a far better fit for high-throughput, long-lived systems than most teams realize.

    I wrote about why enterprises should stop shipping notebooks and start treating AI as real software again.

    the-main-thread.com/p/java-ai-

    #AI #Java #Quarkus #LLMs #ONNX #SoftwareArchitecture

  35. Working on INT8 quantization in the Darknet ONNX export tool. We already have support for FP32 and half-size FP16. But support for INT8 quantization is turning out to be much harder to implement. #Darknet #YOLO #ONNX

  36. 📉 So, it turns out #ONNX and #CoreML have a sneaky habit of downgrading your models to #FP16 without so much as a polite cough. 🤦‍♂️ But don't worry, there's a hero's journey through a forest of matrices and formats to fix this *not-a-bug*. Design choices, amirite? 😂
    ym2132.github.io/ONNX_MLProgra #ModelDowngrade #DataScience #HackerNews #ngated

  37. 📉 So, it turns out #ONNX and #CoreML have a sneaky habit of downgrading your models to #FP16 without so much as a polite cough. 🤦‍♂️ But don't worry, there's a hero's journey through a forest of matrices and formats to fix this *not-a-bug*. Design choices, amirite? 😂
    ym2132.github.io/ONNX_MLProgra #ModelDowngrade #DataScience #HackerNews #ngated