home.social

#onnx — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #onnx, aggregated by home.social.

fetched live
  1. От капстоуна к продакшену: fail‑fast, structured logs, Prometheus и Docker‑образ 8.15GB → 1.35GB

    У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».

    habr.com/ru/articles/1071230/

    #docker_image_size #onnx #sentencetransformers #fastapi #prometheus #grafana #structlog #mlops #RAG

  2. Released a Q4 ONNX Runtime GenAI conversion of inclusionAI/Ling-3.0-tiny 🚀

    • 7.9B total / 1.3B active parameters
    • Hybrid KDA + MLA architecture preserved
    • Sparse 128-expert MoE with top-8 routing
    • 4.85 GB download
    • CUDA inference
    • Tested end-to-end on RTX 5090

    Model + quickstart:
    huggingface.co/webbrain-one/Li

    Original:
    huggingface.co/inclusionAI/Lin

    #ONNX #LocalAI #MachineLearning

  3. 📊 Leads every instruction-following benchmark and nearly all tool-use benchmarks against models up to 4x its size, trailing only #Qwen3_5 9B on BFCLv4 — coding remains the weaker area

    🔧 Day-one support for #llamacpp (GGUF), #MLX, #vLLM, #SGLang and #ONNX across Apple, AMD, Qualcomm and NVIDIA hardware

  4. I created this free open source dashcam app

    It turns your phone into an on device computer vision police detector, spotting patrol vehicles on the road in real time

    dashradar.app

  5. В 14 раз быстрее: как мы ускорили генерацию эмбеддингов в Manticore через ONNX

    Когда мы выпустили Auto Embeddings — функцию автоматического преобразования текстов в векторные представления — без развёртывания отдельного сервиса для работы с ML-моделью, — главный запрос пользователей касался скорости работы. Ранее для генерации эмбеддингов использовался только стек SentenceTransformers поверх Candle (Rust-рантайм Hugging Face для ML-инференса), и ресурсы CPU использовались далеко не полностью: в большинстве сценариев нагрузки показатель QPS держался на уровне нескольких десятков документов в секунду независимо от способа подачи данных, а параллельные запросы обрабатывались последовательно в рамках одной сессии модели. Поэтому мы в течение нескольких недель оптимизировали механизм запуска ONNX-моделей в Manticore. Новый бэкенд ONNX Runtime доступен начиная с Manticore Search 27.1.5 . ONNX (Open Neural Network Exchange) — переносимый формат моделей, в котором уже публикуется большинство популярных open-source моделей для эмбеддингов: MiniLM, BGE, E5 и другие. В результате получилось решение, которое в среднем в 14 раз быстрее прежней реализации SentenceTransformers/Candle на том же оборудовании (обычный недорогой сервер с 16 ядрами / 32 потоками), с той же моделью и теми же весами, если усреднить по всей матрице замеров threads × batch , — и это преимущество сохраняется как при одном клиентском потоке, так и при тридцати двух. Предыдущая реализация во всём диапазоне нагрузок показывала 5–11 документов/с; новая реализация работает в диапазоне 70–230 документов/с.

    habr.com/ru/articles/1051864/

    #onnx #onnx_runtime #onnxruntime #embeddings #эмбеддинги #инференс #векторный_поиск #vector_search

  6. Per anni l'audio su Linux ha significato scegliere tra PulseAudio e JACK, e farli litigare.

    PipeWire 1.6 ha chiuso la partita: un solo sistema, e funziona. 👇
    gomoot.com/dal-caos-pulseaudio

    #audio #Linux #midi #ONNX #opensource #Pipewire

  7. Как я завёл нормальный голос в детское приложение, не разорившись и не заставив никого лезть в настройки

    Я в одиночку делаю детское приложение, где дети учат английский через рисование: рисуют слова, а оно распознаёт рисунок и отвечает голосом. В MVP голос был системный — бесплатный, но звучит как робот из нулевых, пока сам не зайдёшь в настройки и не докачаешь нормальный. Я сделал модалку с инструкцией. Угадайте, сколько людей ей воспользовались. Короче, примерно никто. Значит, хороший голос должен достаться всем сразу, без единого телодвижения юзера. И при этом дёшево — причём не только по деньгам. Рассказываю, как я завёл озвучку через ElevenLabs так, что в проде она почти ничего не стоит, работает офлайн и отвечает мгновенно. Ключ оказался в одном наблюдении: всё, что приложение когда-либо скажет, известно заранее. А ещё — почему, когда ты соло и кодишь в паре с агентом, главные проверки в пайплайне работают за ту команду, которой у тебя нет. Как это устроено

    habr.com/ru/articles/1047888/

    #TTS #ElevenLabs #React_Native #Expo #Cloudflare_Workers #детские_приложения #ONNX #TDD #AIразработка #Claude_Code

  8. Компиляция yolov8n в формат HEF для Hailo-8L на Raspberry Pi 5

    Подготовка модели Yolo для запуска на базе Hailo чипа для Raspberry Pi 5 AI HAT+. Если есть интерес к легким аппаратным решениям в области ИИ, то добро пожаловать. В статье я затрагиваю вопрос подготовки модели детекции к работе на компактной малинке.

    habr.com/ru/articles/1048976/

    #onnx #hailo #hailo8 #raspberry #ultralytics #yolo #yolo8 #ml #mlops #ai

  9. I'm writing a C# app with ONNX for facial detection and in part of it doing `tensor[0, 2, y, x] = r`. After running the app for a day it used almost 8 GB memory. I coudldn't really find any obvious memory leaks, but found that the indexer actually created a temporary `int[]`. I refactored the indexer to `tensor[2 * width * height + y * width + x] = r`, and did some other (unrelated changes). And now a day later it's at 0.4 GB. Is that how this works?

    To pharaphrase the Haskell saying:
    > The [garbage collector] should have protected me from this!

    #csharp #onnx #optimisation

  10. Трансформер в on-premise AppSec: как мы встроили ML-модель для классификации секретов в продукт без GPU

    Рассказываем, как мы интегрировали CodeBERT-based модель классификации секретов в production-продукт с жёсткими ограничениями по железу, сократив время инференса с 320 до 90 секунд и размер модели с ~600 до ~130 МБ — без дискретных ускорителей и тяжёлых зависимостей.

    habr.com/ru/companies/codescor

    #appsec #onnx #mlops #opensource #оптимизация #codescoring #ml

  11. Govorun PC: переносим офлайн-диктовку с Android на Windows за один вечер (с Claude)

    На Android у меня живёт Govorun Lite — офлайн-диктовка на русском. Нажал кнопку, сказал, текст вставился. Никаких облаков, никакой отправки голоса на серверы. Работает через GigaAM v2 от Сбера. Проблема одна: на ПК такого нет. Встроенная Windows-диктовка — онлайн. Whisper — либо медленный, либо требует видеокарту. Сторонние сервисы — снова облако. Я решил портировать Govorun на Windows, и для ускорения взял Claude как пару-программиста. Что из этого вышло — в этой статье.

    habr.com/ru/articles/1031240/

    #python #speechrecognition #onnx #windows #llm #голосовой_ввод

  12. 🍏🔪 #Apple thinks it's clever by running #ONNX in a browser, promising AI-powered Gaussian Splats—because nothing screams cutting-edge tech like mathematical blobs. 🖥️🤖 GitHub's turning into a buzzword bingo, but hey, at least the navigation menu's toggle switch works. 🎉🙄
    github.com/bring-shrubbery/ml- #AI #GaussianSplats #GitHub #BuzzwordBingo #TechNews #HackerNews #ngated

  13. Приложение real-time face swap на чистом Rust: ONNX Runtime, lock-free потоки и 60 кадров в секунду

    Большинство инструментов для замены лиц это Python-скрипты, склеенные из PyTorch, OpenCV и надежды. Они работают, но тащат за собой гигабайты зависимостей, требуют правильно настроенного CUDA и разваливаются в тот момент, когда ты пытаешься запустить их в реальном времени. Мне стало интересно: можно ли собрать весь пайплайн на чистом Rust? Без Python. Без PyTorch. Без обёрток. Один бинарник, который скачал, распаковал и запустил. Оказалось, можно. 60 fps на веб-камере. Пайплайн На каждом кадре последовательно отрабатывают четыре нейросети. RetinaFace находит лица и извлекает пять ключевых точек. ArcFace вычисляет 512-мерный эмбеддинг исходного лица. InSwapper принимает регион целевого лица и эмбеддинг источника, на выходе отдаёт заменённое лицо. GFPGAN опционально улучшает результат для более высокого качества. Все четыре модели работают через ONNX Runtime. Никаких кастомных CUDA-ядер, никакого оверхеда фреймворков. Тензор на вход, тензор на выход. Архитектура потоков Три потока, ноль блокировок на горячем пути. Поток захвата получает кадры с веб-камеры через nokhwa и публикует их через ArcSwap. Поток пайплайна подхватывает новые кадры, прогоняет инференс и публикует обработанные кадры через второй ArcSwap. Поток UI читает актуальный буфер и рендерит через egui. Никаких мьютексов на данных кадра. Никаких каналов. Никакого async. Только атомарные счётчики поколений и lock-free замена указателей. Структуры разделяемого состояния занимают ровно по 64 байта каждая и выровнены по кэш-линиям, чтобы исключить false sharing между ядрами. Это проверяется compile-time ассертами.

    habr.com/ru/articles/1024700/

    #Rust #ONNX #Machine_Learning #Computer_Vision #Face_Detection #egui #Open_Source #lockfree #multithreading #realtime