#軟體 — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #軟體, aggregated by home.social.
-
整合 AI agent 的 Microsoft Intelligent Terminal
「Windows Terminal」(Microsoft Store)是微軟推出很久的一套命令提示字元的「外殼」,可以透過它來操作 cmd、PowerShell、WSL 等命令提示字元工具;由於提供了相對方便的 tab、色彩/字形設定,所以個人是覺得還滿好用的。
印象中,很久以前就有看到微軟有試著在裡面加上 AI 的功能,但是正式版好像都沒看到要推出的跡象?不過到了前陣子、微軟倒是決定把和 AI 整合的版本、獨立出來變成「Intelligent Terminal」了!而現在也發布了 0.1 版、讓有興趣的人可以玩了~
官方的公告是《Announcing Intelligent Terminal 0.1》,有興趣的人可以直接到 Microsoft Store 下載、安裝了。由於它也是開放原始碼的專案,所以也可以到 GitHub 找到原始碼。
他基本上是 Windows Terminal 的一個分支、主要的差別就是原生整合 agent、可以在繼續使用各種 command line 工具的時候、快速地使用既有的 AI agent 來做輔助。
它雖然預設會使用 GitHub Copilot CLI 來做 agent,不過因為它支援所有符合 Agent Client Protocol (ACP) 標準的 agent,所以理論上使用彈性相當地高,也可以支援 Gemini 或 Claude 等 agent。
在台灣的繁體中文環境安裝後,他的應用程式名稱會是「智慧終端機」,初次執行畫面如下:
按「下一步」後,會要求開始做初期設定。
這邊可以選擇要使用哪個 agent、選項應該是會根據目前系統有安裝的 agent 而有所變化?不過 Heresy 明明沒裝 Claude 卻還是顯示「已安裝」…
另外,這邊雖然只有顯示這三個 agent,但是之後還是可以自己加入其他符合 ACP 的 agent 的。同時,這邊的設定之後也都可以修改。
在按下儲存後,左下角可能會跳出「PowerShell 執行原則正在封鎖指令碼。錯誤偵測已關閉。」的錯誤:
點選下方的連結會開啟官方的說明文件(連結),這邊基本上就是要放寬 PowerShell 執行腳本的權限;指令是:
Set-ExecutionPolicy -Scope CurrentUser -ExecutionPolicy RemoteSigned
不過可能要注意的是,如果電腦上除了本來的 PowerShell(5.1、
powershell.exe)外、還有另外安裝 PowerShell Core(7+、pwsh.exe)的話,上面的指令應該會需要在兩種 PowerShell 都執行一次,否則還是會有問題。設定完後,就可以使用了~他預設會是上方顯示本來的 Shell CLI、下方則會變成是 agent 的畫面。
這邊比較討厭的,是雖然圖形介面算是有完整的繁體中文翻譯,但是 agent 這邊預設都是用簡體字顯示…
在左下方有個方形的圖示、可以用來開關 agent 的區域,不過實際上應該是使用「
Ctrl+Shift+.」這組快速鍵來控制會比較順手。右下角則有三條線、點選後會顯示過去的工作階段(快速鍵是
Ctrl+Shift+/);這邊的工作階段應該是直接從 agent 那邊抓來的,所以如果本來有透過 agent 做過的事情、這邊都會顯示出來。至於他有什麼用呢?比較方便的用法,應該是把「自動錯誤偵測」、「自動錯誤建議」開啟,這樣在 shell 指令出錯的時候,他就會自動把錯誤送給 agent、讓 agent 來解釋了!
像這邊 Heresy 故意在一個不是 git repo 的資料夾執行「
git log」,下面 agent 區域就會跳出錯誤的說明了~由於這邊的指令是對的、所以他也沒辦法提出修正方案。
但是如果是在一個 git repo 的資料夾執行「
git logs」這樣的錯誤指令的話,他就會顯示正確的指令、並可以快速選取並執行:這邊只要按下 Enter,他就會把正確的「
git log」輸入並執行,完成本來要做的操作。如果想要再調整指令,也可以按下鍵盤的向右箭頭、切換到「插入到終端」後再按 Enter,這樣就會把指令帶進 shell 讓使用者自己做後續修改了。
當然啦~這個例子是相對非常簡單、git 本來就有給出建議指令的;不過如果是ㄧ些比較複雜的例子的話,這邊的 agent 就可能可以讓使用者不用離開 CLI 環境、直接找到解決方案的。
而如果是要在 shell 和 agent 之間切換的話,則可以使用「
Ctrl+Shift+I」這組快速鍵來快速切換。所以如果是遇到想要某個操作、但是完全不知道怎麼下指令,也可以切換到 agent 去詢問。比如說這邊想找內容裡面有「module」這個字串的 .cpp 檔案的話,只要輸入「幫我找內容有 module 的 .cpp 檔案」,他就會給一個建議的 PowerShell 指令來讓使用者決定是否要執行:
Get-ChildItem -Recurse -Filter *.cpp | Select-String -Pattern "module"
下面是他的畫面:
另外,雖然不多,這邊他也有提供幾個「
/」的指令可以操作。之餘針對 agent 的設定應該是要回到 agent 去設定了。
如果正常操作的時候不想看到 agent 的畫面佔用太多版面的話,也可以平常的時候先關掉、繼續操作;而當執行的指令有錯誤的時候,他會在左下角顯示提示,這時候只要按下
Ctrl+Shift+.來開啟面板、並進行操作了。這樣的操作應該會是侵入性相對少、也可以保有大量顯示區域的方式了。
另外,理論上在使用時也可以透過「
Alt+Shift+/」來開啟對話框(他取名叫做「命令選擇區」)、然後在這邊向 AI 詢問問題或是要求他做某些工作。不過這邊的操作邏輯是另外開一個 tab 來執行 agent,設計上應該是為了避免卡住目前的工作。而 Heresy 自己測試的時候運作是不太正常的狀態…感覺上中文沒辦法正確透過參數傳遞、結果都沒辦法正確執行。
在設定的部分,和本來的 Windows Terminal 類似,都是點選上方 tab 旁的向下箭頭、選擇「設定」來開啟;感覺上他預設會去複製 Windows Terminal 本來的設定?
他在左邊則是多出了一個「AI 代理」的選項,可以在這邊調整相關的設定。
這邊的設定大多和前面初始化時一樣。
比較特別的,是這邊的代理設定可以自己新增了。
如果是要透過 OpenCode 來操作的話,可以在命令的地方輸入「
opencode acp」來設定。另外要注意的,是前面提到的「命令選擇區」的 agent 設定是獨立的,要在下方另外修改才行;以 OpenCode 來說,這邊是要填入「
opencode run」。而如果前面 PowerShell 的腳本執行權限沒有解決完整的話,這邊按下儲存可能就會出現「Shell 整合錯誤」的訊息。
Heresy 一開始因為只在 pwsh 設定,所以這邊一直跳錯…後來到 powershell 也修改權限後才正常。
目前覺得比較可惜的,大概是要搭配 Linux 使用不是很實用?這邊是碰到的問題:
- Heresy 這邊搭配 WSL 似乎有問題,每個指令都會被當作有問題送給 agent 分析,浪費 AI 的 token。
- WSL 雖然可以建議的指令插入、但是沒辦法直接執行?
- SSH 到遠端後的錯誤不會被偵測到、所以也無法分析。
這邊有的可能是設計機制的問題就是了。
#AI #電腦相關 #軟體 #Windows #微軟 -
Gemini in Chrome 可以透過「技能」儲存提示詞了
之前在《Gemini in Chrome 初步使用感想》有介紹過,台灣的用戶終於可以使用「Gemini in Chrome」的功能了!如此一來,在使用 Chrome 看網頁的時候,要透過 AI 來輔助就更方便了~
當時也有提到,雖然根據網路上的資訊,這邊的 Gemini 應該是有提供「Skills」、可以把自己經常用到的提示詞儲存下來,方便後續使用;不過,在上個月的時候,是都沒能找到這項功能。
而前幾天,Heresy 忽然發現,自己的 Gemini in Chrome 已經有「技能」可以用了!
現在再輸入完提示詞送出後,在提示詞的左邊、會有兩個圖示,其中「閃電」就是「儲存為技能」的功能。
點下去後,就會跳出「新增技能」的對話框,這邊會幫它取個名字就可以儲存了;而有必要的話,也可以根據「指令」再做調整。
之後呢,只要在 Gemini in Chrome 的對話區點選左下角的「+」、就可以看到多出「技能」的分類了~
不過,點選技能不會直接送出、而是會出現「/翻譯」這樣的指令,之後需要自己在送出。
這樣的缺點是操作上還是略為麻煩,要執行一個技能總共要三個步驟;不過好處則是還可以繼續輸入補充的提示詞、在使用的時候可以針對既有的技能做補充的說明。
最後,雖然不知道怎麼透過圖形介面開啟,但是 Chrome 有提供一個特殊的頁面 chrome://skills/yourSkills,可以用來瀏覽、管理既有的技能。
如果要刪除的話,應該就是要來這了。
大概就是這樣了,個人是覺得這樣便方便不少了。
不過,雖然 Gemini in Chrome 應該和常規的 Gemini 是互通的,內容在 Gemini 的網頁也可以看到;但是這邊的技能基本上只有在 Gemini in Chrome 能用不知道以後會不會調整?
#AI #Chrome #網頁瀏覽器 #電腦相關 #軟體 #gemini #Google -
自製程式:可自定義功能的 ClipboardAssistant
在 PowerToys 的「進階貼上」可以串接第三方的 AI 服務後,Heresy 有好一段時間都透過他的自定義提示詞、並搭配快速鍵的功能,來使用 LLM 的服務進行快速翻譯。
不過,進階貼上的快速鍵實際上沒有辦法直接針對單一指令設定全域快速鍵、所以操作上算是有點麻煩;再加上他的設計概念畢竟是「貼上」,所以和 Heresy 只是想看結果的使用情境也有相當的落差。
後來忽然在想、既然現在可以叫 AI 寫程式了,那乾脆就寫一個符合個人需求的吧!所以,就有 Clipboard Assistant 這個程式出來了~
他的專案是:https://github.com/KHeresy/ClipboardAssistant
下載請到 release 的頁面:https://github.com/KHeresy/ClipboardAssistant/releases
這個程式是使用 C++ 和 Qt 6 開發的,理論上應該是可以跨平台,不過 Heresy 自己只有建置 Windows 版本就是了。
這個程式的基本理念,是透過快速鍵來開啟程式、並根據使用者定義的流程來處理剪貼簿內的內容;處理完的結果,可以直接貼上、也可以不貼上只顯示出來。
而在流程的部分,基本上是設計成可串接、可擴充的形式,所以理論上可以做到非常多的事情。
目前可以串接的功能,包括了:
- OpenAI API 相容服務
- Google Gemini API
- 正規表示式(regular expression)的文字取代
- JavaScript 的文字處理
- 執行外部程式
- 文字輸入
透過前面兩個 AI 模組,基本上可以用來快速地翻譯選取的文字,也可以截圖要 AI 解釋、翻譯,算是有做到 Heresy 的需求了~
下面是一個簡單的動作集的設定畫面:
這邊可以設定是否要自動複製、也可以在啟動時進行螢幕擷取,也可以設定在完成後可以設定要怎麼處理。這個範例只有一個 OpenAI 的動作,可以設定自己需要的提示詞,不過基本上可以串多個。
透過這樣的設計,只要按下設定好的快速鍵,就可以執行自己定義的流程了~以翻譯、或是解釋畫面來說,就不用自己貼到網站、也不用每次都要輸入提示詞了!
而如果有經常性要以固定的流程、形式處理字串的話,也可以透過 JavaScript 來處理;在定義好動作後,基本上可以在選取好文字後、按下快速鍵就完成整個處理流程~在很多時候是可以大幅提高效率的。
附註:
目前 OpenAI / Gemini 的 API Key 會以明文方式,透過 QSettings 儲存於系統內,預設應該會儲存在 Registry 中,這基本上算是個資安風險。
現在的 AI 真的好可怕…但是感覺用了之後人真的會變懶得思考…
-
Visual Studio 2026 18.6.0
Visual Studio 2026 在 2026 年五月的例行性更新推出了,這次的版本推進到了 18.6.0,官方的更新紀錄可以參考 release note。
這次更新的項目,包括了:
- IDE 介面:與系統同步淺色/深色主題
- GitHub Copilot
- 檢視、管理 Agent Skill
- 多檔案變更摘要
- Context Window 使用指標
- 計畫模式
- Git tooling
- 把 Git Commit 丟給 Copilot Chat
- 提交訊息自訂指示現在改為使用 Copilot 指示檔
- C++
- 針對 iterative build 進行最佳化改善
- 支援、預設使用 Segment Heap
- MSVC Build Tools v14.51
按照慣例,更新比較多的還是和 GitHub Copilot 相關的東西。以往由於 Heresy 沒在訂閱、再加上免費版本的 GitHub Copilot 用量非常有限,所以 Heresy 都沒認真玩;不過最近由於有開始透過串接自有 LLM 伺服器來使用,所以以後應該也會來記錄相關的變更吧。
MSVC Build Tools v14.51
在三月份的 18.3、微軟就推出了 MSVC Build Tools 14.51 預覽版、號稱題更了更好的 C++23 相容性、必提升了效能。而在這次的 18.6,則是釋出了 14.51 的正式版本了~這次的官方紀錄是《MSVC Build Tools version 14.51 (GA) now available》。
至於新版的變動,主要是要看之前 RC 版的介紹《MSVC Build Tools Version 14.51 Release Candidate Now Available》,裡面的變更算是相當多。
至於正式版和 RC 差別、似乎只有加入 Intel APX (Advanced Performance Extensions) 指令集? 不過,現在有處理器有支援嗎?
不過,14.51 的 C++23 標準目前還是標記成預覽版、使用的設定是
/std:c++23preview;要變成正是支援,應該還是要等到之後的 14.52 了(參考、參考)。GitHub Copilot 支援 Ollama
雖然更新紀錄沒有寫,但是 GitHub Copilot 的「管理模型」的功能,現在加入了「Ollama」的設定了!
和其他的提供者不同,他不需要輸入金鑰,而是要直接輸入端點 URL;而且也不要 Azure 一樣只支援可認證的 https。
不過實際上…在新增模型的時候,還是可以另外指定端點,所以技術上應該是可以對應多個伺服器。
雖然他寫的是 Ollama,但是它實際上走的應該還是 OpenAI 相容 API,Heresy 自己嘗試用LM Studio 來跑也是沒問題的~不過考慮到他不能設定金鑰,所以基本上就只能對應私有的內部服務了。
考慮到小型模型在開發上的能力…恩,個人應該不太會用吧。
計畫模式
Visual Studio GitHub Copilot 以往主要的模式只有「agent」和「ask」(話說,之前都還有中文翻譯、現在又都變英文了),如果想要讓他規劃的話,通常是使用詢問模式避免他直些修改;而現在終於正式加入一個「plan」模式了。
官方建議使用的時機是:
- 大型功能的開發
- 不熟系的程式庫
- 團隊協助、讓大家確認計畫
根據官方的說法,他會透過下面兩個步驟來處理:
- 探索並釐清
- 草擬並完善
理論上 Copilot 會將計畫以 Markdown 的形式儲存成
.copilot/plans/plan-{title}.md這樣的檔案,方便後續編輯、確認;不過個人覺得很謎的,是他這邊產生的路徑居然是個人資料夾、而不是專案資料夾…在開始撰寫計畫書前,可能會先詢問開發者一些需要釐清的問題,之後在而計劃書完善後,會有一個「實作計畫」的按鈕,按下去就會切換到 agent 模式、根據計畫書開始實作了。
下面就是一個測試用的計畫:
在他繼續實作的時候,還會去改變裡面的進度、也會在下方的「計畫步驟」前面打勾作狀態的修改;這樣整個流程會變得可以更直覺、明確地看到大型任務的進度,個人覺得還滿棒的。
而除了手動使用 plan 模式外,現在在 agent 模式要做 AI 模型覺得比較大幅度的改動的時候,似乎也會主動建立一個類似 plan 模式的計畫書、然後再直接開始實作;這個狀況下其實和 plan 模式很像,只是缺少的檢查計畫書的時間。
不過 Heresy 這邊有一個問題:使用者目錄下的這些檔案是要自己去刪除嗎?感覺計畫完成他就留在那了啊…感覺如果是在專案目錄還好,但是全部都是在個人目錄下啊…
另外,不知道他是不是會挑模型?gpt-5.4、gpt-5.4-mini 看來都可以正常對應這個流程,但是有的內部模型測試的時候,似乎會跳出這個流程?所以如果使用非官方模型、可能也是要試試看才知道了。
Context Window 使用指標
現在聊天框的右上角會有一個顯示目前 context window(內容視窗)使用量的圓環,點下去會顯示目前的使用狀況:
再點下去也可以展開系統、使用者內容的細節。
如果 context window 被塞滿的話,他可能就會忘記之前的內容、進而造成奇怪的問題。所以如果這個發現這個圈快滿了、也可以點選「摘要交談」的按鈕、來針對較早的對話進行內容的分析、壓縮,避免遺失重要的上下文。
這個按鈕按下去不會輸出摘要後的內容,而是只會顯示「摘要已完成」,然後理論上 context window 的使用比例就會變少了。
多檔案變更的彙整
Copilot 在編輯檔案後,會在聊天框上方列出變更過的檔案;以往只能一個一個點開來看改了什麼,不過現在可以點選「開啟變更摘要檢視」、來透過單一文件視窗確認所有的變更了。
不過老實說,這樣的檢視方式,感覺只適合每個檔案都只改依兩行的狀況?
Agent Skill 管理
現在在聊天窗格右下角的工具設定裡面,除了本來的 MCP 外,現在也加入了簡單的 Skill 列表。
不過這邊的功能現在真的很簡單,只能開啟資料夾和編輯
SKILL.md,並沒有類似建立新的 skill 的輔助工具;微軟目前應該是還在測試建立 Skill 的功能,或許下個月正式版就會有機會看到了吧?(參考《Agent Skills in Visual Studio: Teach Copilot How Your Team Works》)至於 Visual Studio 的 Skill 到底要怎麼設定呢?根據官方文件的說法,應該就是要自己撰寫
SKILL.md、然後按照特定的邏輯放在指定的資料夾裡了。或者是 awesome-copilot 這個專案裡面放了很多 Skill 可以參考(連結)。
大概就先這樣了。
開始認真用 GitHub Copilot 後,發現現在的 GitHub Copilot 真的和以前差很多;而由於最新的高階 LLM 的進步,寫出來的程式的可用性和複雜度也提高相當多了。
但是,高階的模型的 token 真的燒很快、錢也扣得很兇啊…
#AI #C #C23 #程式設計 #電腦相關 #軟體 #GitHubCopilot #Microsoft #VisualStudio
而且開始用了之後,真的覺得人會懶得思考啊… -